DEV Community

Cover image for TwelveLabs y la Capa de Memoria de Video: Revolucionando la Comprensión de la IA
StartupHub.ai
StartupHub.ai

Posted on

TwelveLabs y la Capa de Memoria de Video: Revolucionando la Comprensión de la IA

#ai

La inteligencia artificial ha avanzado a pasos agigantados, pero cuando se trata de comprender el video, aún enfrentamos desafíos significativos. James Le de TwelveLabs presentó recientemente un concepto fascinante en el AI Engineering World's Fair: una 'capa de memoria' para la inteligencia de video. Su argumento es contundente: los sistemas de IA actuales fallan en la verdadera comprensión del video porque carecen de este componente esencial de memoria y, a menudo, aplican de forma inapropiada principios extraídos de modelos de lenguaje. Esta innovación no es solo un avance incremental; es crucial para desbloquear todo el potencial del análisis de video.

Las Limitaciones del Video IA Actual

Le comenzó su presentación señalando una falla fundamental en la mayoría de los sistemas de IA de video: una falta sistémica de memoria. Explicó que el video es mucho más que una simple colección de fotogramas; es un 'volumen espaciotemporal' dinámico, cargado de información visual, diálogos, sonidos, movimiento, reconocimiento óptico de caracteres (OCR), cambios de cámara y mucho más. La continuidad y las interrelaciones dentro de este volumen son primordiales para una comprensión genuina. Sin embargo, los enfoques de IA actuales a menudo reducen el video a una serie de imágenes estáticas o a una mera transcripción, descartando este dato contextual crítico.

Le identificó tres problemas principales con las pilas de video IA existentes:

  • Tratar el video como una 'bolsa de fotogramas' o transcripción: Este enfoque descuida el contexto espaciotemporal crucial, lo que lleva a una comprensión fragmentada.
  • Forzar el video en secuencias de texto: Este método descarta las relaciones espaciotemporales y las definiciones de eventos que son inherentes al video.
  • Falta de memoria: Sin una memoria persistente, los sistemas de IA no pueden retener y recordar información a través de diferentes partes de un video, lo que dificulta el análisis complejo.

Además, enfatizó que las características inherentes del video —dependencias temporales, multimodalidad, densidad, ambigüedad y costo— hacen que el desarrollo de sistemas de memoria efectivos sea particularmente desafiante.

La Plataforma 'Jockey' de TwelveLabs: Una Solución de Memoria de Video

En respuesta a estas limitaciones, TwelveLabs ha desarrollado un enfoque novedoso centrado en una 'capa de memoria'. Esta innovadora pila comienza procesando el video en 'trozos semánticos', que representan unidades temporales significativas. Estos trozos se codifican luego en incrustaciones vectoriales utilizando un codificador espaciotemporal llamado 'Morango'.

En el núcleo de su solución se encuentra un 'almacén de contexto espaciotemporal', diseñado para preservar estructuras reutilizables como momentos, entidades y metadatos. Este almacén actúa como la memoria del sistema. Complementando esto está 'Pegasus', un modelo de lenguaje sensible al contexto de video que funciona como la capa de razonamiento, permitiendo a la IA interpretar y actuar sobre la información almacenada.

Le trazó una clara distinción entre la búsqueda simple y la memoria real. Mientras que la búsqueda puede localizar momentos relevantes, la memoria se trata de preservar el significado y permitir que los sistemas respondan preguntas complejas que requieren la comprensión de las líneas de tiempo de las entidades y la evidencia inter-corpus. Esta capacidad de retener y recordar información es lo que permite una comprensión más profunda y matizada del contenido de video.

El Grafo de Contexto y Principios Clave

Para facilitar esta comprensión más profunda, Le propuso representar colecciones de video como un 'grafo de contexto'. Esta representación duradera y consultable conecta momentos, entidades, apariciones, relaciones y contexto a nivel de corpus. Dicho grafo permite a las aplicaciones navegar por el contenido de video desde múltiples perspectivas y a través de diferentes puntos en el tiempo, ofreciendo una flexibilidad analítica sin precedentes.

Esbozó cinco principios clave para la construcción de una capa de memoria de video robusta:

  1. Acceso a la Memoria: La capacidad de recuperar y utilizar la información almacenada de manera eficiente.
  2. Planificación de Tareas: Permitir al sistema idear y planificar acciones basadas en la memoria disponible.
  3. Recuperación: Obtener con precisión piezas específicas de información del almacén de memoria.
  4. Utilización de Herramientas: Integrar herramientas o funcionalidades externas según sea necesario.
  5. Envolventes Operativas y Contratos de Salida: Definir los límites operativos y los resultados esperados para el sistema.

Le explicó que si bien los modelos de IA proporcionan respuestas, son los 'trabajadores de video' que operan dentro de este sistema, aprovechando la memoria y la evidencia, quienes planifican tareas, recuperan momentos relevantes y sintetizan resultados. Este paradigma de trabajador exige capacidades específicas, incluido el acceso a la memoria, la planificación de tareas, la recuperación, la utilización de herramientas, las envolventes operativas, los contratos de salida y la evaluación.

Desbloqueando Nuevas Aplicaciones con Jockey

El producto de TwelveLabs, 'Jockey', es la encarnación de esta capa de memoria de video. Está diseñado para producir estas capacidades avanzadas, ofreciendo almacenes de conocimiento, procesos de ingesta configurables y una potente API. Le enfatizó que Jockey no es una aplicación ni una plataforma de edición, sino la 'infraestructura de cognición' fundamental que impulsa estas aplicaciones.

Jockey desbloquea una amplia gama de aplicaciones potenciales, como se demostró a través de tres casos de uso clave:

  • Medios y Entretenimiento: Mejora del descubrimiento de contenido, la resumen y las recomendaciones personalizadas.
  • Seguridad Pública y Seguridad Comercial: Permite un análisis de incidentes más rápido, detección de amenazas y recuperación de evidencia.
  • Publicidad y Economía de Creadores: Facilita la reutilización de contenido, el análisis de tendencias y la generación automatizada de resúmenes.

Estos ejemplos ilustran cómo Jockey puede mejorar significativamente los flujos de trabajo y crear nuevas posibilidades en diversas industrias. La plataforma se encuentra actualmente en beta privada, y TwelveLabs anima a los desarrolladores que trabajan en flujos de trabajo de ensamblaje u organización de contenido a explorar sus capacidades. Este avance en la IA de video, impulsado por el concepto de una capa de memoria de video, promete un futuro donde la IA pueda interactuar y comprender el contenido de video de una manera mucho más sofisticada y similar a la comprensión humana.

Este desarrollo es particularmente relevante en el panorama más amplio de la IA, donde los avances en áreas como la IA NSFW también están ampliando los límites de lo que la IA puede procesar y comprender, aunque en dominios diferentes.

tags: video ai, artificial intelligence, machine learning, computer vision

Top comments (0)