Comunicados de Prensa
Innovador software transformará videos en documentos resumidos
El software convierte videos de presentación en PDF organizados y buscables, con resúmenes de texto e imágenes relevantes.
Los videos de presentación son ampliamente utilizados para compartir información, pero pueden ser difíciles de buscar, analizar y almacenar de manera eficiente. Para abordar esto, los investigadores desarrollaron PV2DOC, un software que transforma el contenido de video en documentos PDF estructurados y buscables.
El software integra datos visuales y de audio, incluidos texto, imágenes, figuras y fórmulas, para crear un resumen conciso del video, haciendo la información más accesible y reduciendo los requisitos de almacenamiento. Seguramente, se ha encontrado con videos de estilo presentación que combinan diapositivas, figuras, tablas y explicaciones orales. Estos videos se han convertido en un medio ampliamente utilizado para transmitir información, particularmente después de la pandemia de COVID-19, cuando se implementaron medidas de confinamiento.
Aunque los videos son una forma atractiva de acceder al contenido, tienen desventajas significativas, como ser un proceso que lleva mucho tiempo, ya que se debe ver todo el video para encontrar información específica, y el hecho de que ocupan un espacio de almacenamiento considerable debido a su gran tamaño de archivo. Investigadores liderados por el Profesor Hyuk-Yoon Kwon en la Universidad Nacional de Ciencia y Tecnología de Seúl en Corea del Sur buscaron abordar estos problemas con PV2DOC, una herramienta de software que convierte videos de presentación en documentos resumidos.
A diferencia de otros resumidores de video, que requieren una transcripción junto al video y se vuelven ineficaces cuando solo se dispone del video, PV2DOC supera esta limitación al combinar datos visuales y de audio y convertir el video en documentos. Este artículo fue publicado en línea el 11 de octubre de 2024, y fue publicado en el Volumen 28 de la revista SoftwareX el 1 de diciembre de 2024. “Para los usuarios que necesitan ver y estudiar numerosos videos, como conferencias o presentaciones, PV2DOC genera informes resumidos que pueden leerse en dos minutos. Además, PV2DOC gestiona figuras y tablas por separado, conectándolas con el contenido resumido para que los usuarios puedan consultarlas cuando las necesiten,” explica el Prof. Kwon.
Para el procesamiento de imágenes, PV2DOC extrae fotogramas del video a intervalos de un segundo. Utiliza un método denominado índice de similitud estructural, que compara cada fotograma con el anterior para identificar fotogramas únicos. Se detectan objetos en cada fotograma, como figuras, tablas, gráficos y ecuaciones, mediante modelos de detección de objetos, como Mask R-CNN y YOLOv5. Durante este proceso, algunas imágenes pueden quedar fragmentadas debido a espacios en blanco o subfiguras. Para resolver esto, PV2DOC aplica una técnica de fusión de figuras que identifica áreas superpuestas y las combina en una sola figura.
A continuación, el sistema aplica reconocimiento óptico de caracteres (OCR) utilizando el motor Google Tesseract para extraer texto de las imágenes. El texto extraído se organiza en un formato estructurado, como encabezados y párrafos. Simultáneamente, PV2DOC extrae el audio del video y utiliza el modelo Whisper, una herramienta de conversión de voz a texto (STT) de código abierto, para convertirlo en texto escrito. El texto transcrito se resume utilizando el algoritmo TextRank, creando un resumen de los puntos principales. Las imágenes y el texto extraídos se combinan en un documento Markdown, que puede convertirse en un archivo PDF.
El documento final presenta el contenido del video —como texto, figuras y fórmulas— de manera clara y organizada, siguiendo la estructura del video original. Al convertir datos de video desorganizados en documentos estructurados y buscables, PV2DOC mejora la accesibilidad del video y reduce el espacio de almacenamiento necesario para compartir y almacenar el video. “Este software simplifica el almacenamiento de datos y facilita el análisis de datos para videos de presentación al transformar datos no estructurados en un formato estructurado, lo que ofrece un potencial significativo desde las perspectivas de accesibilidad de información y gestión de datos. Proporciona una base para una utilización más eficiente de los videos de presentación,” comenta el Prof. Kwon.
Los investigadores planean agilizar aún más el contenido de video en formatos accesibles. Su próximo objetivo es entrenar un modelo de lenguaje grande (LLM), similar a ChatGPT, para ofrecer un servicio de preguntas y respuestas, donde los usuarios puedan preguntar sobre el contenido de los videos, y el modelo genere respuestas precisas y relevantes contextualmente.
Comunicados de Prensa
Call of Duty Modern Warfare 4 revela la guía de la FOB y el acceso anticipado a DMZ
Activision e Infinity Ward publicaron la segunda parte de la guía táctica de DMZ, la experiencia de extracción en mundo abierto de Call of Duty: Modern Warfare 4. El informe detalla la Base de Operaciones Avanzada (FOB) y confirma el calendario de acceso anticipado: Campaña desde el 16 de octubre y DMZ completo desde el 20 de octubre de 2026, previo al lanzamiento global del 23 de octubre.
Comunicados de Prensa
Crazy Taxi World Tour presenta su mapa de Brasil en Brasil Game Show
SEGA confirmó durante la conferencia de prensa de Brasil Game Show 2026 que Brasil será la más reciente ubicación internacional de Crazy Taxi: World Tour, la nueva aventura de la franquicia creada por Kenji Kanno. El anuncio incluyó un tráiler del nuevo mapa y la revelación de tiendas reales reconocibles dentro del juego, con lanzamiento previsto para 2027.
Comunicados de Prensa
Playground de Google Labs crea videojuegos con IA sin programar
Google Labs presentó Playground el 7 de octubre de 2026, una plataforma experimental que convierte descripciones de texto en videojuegos jugables desde el navegador, sin escribir una sola línea de código. El servicio debutó en Estados Unidos para mayores de 18 años y ya cuenta con galería comunitaria, tablas de posiciones y una integración con Unity en camino.
-
Apps11 años agoAMPcast, la herramienta de Pandora que permite a los artistas grabar mensajes de audio directamente a sus seguidores
-
Blogs5 años agoConoce los mejores sitios de Torrents para descargar todo tipo de contenidos
-
Android5 años agoAprende cómo usar Discord para ver películas con tus amigos
-
Arte y Cultura14 años agoColección de fondos de pantalla basados en Super Héroes
-
Almacenamiento2 años agoCómo usar TeraBox: La guía definitiva para aprovechar 1 TB de almacenamiento en la nube
-
Diseño13 años agocss3ps: plugin que convierte archivos PSD a CSS3
-
Apps9 años agoPicturethat, app que usa la Realidad Aumentada para visualizar cómo quedarían los cuadros antes de colgarlos
-
Eventos Especiales13 años agoEspecial Día de la Madres: fondos de pantalla especiales para Mamá
