Twelve Labs
Por qué importa
En profundidad
Twelve Labs fue fundada en 2021 por Jae Lee y Aiden Lee, quienes vieron una brecha masiva en el panorama de IA: mientras los modelos basados en texto avanzaban a velocidad vertiginosa, el video seguía siendo tercamente opaco para las máquinas. Podías pedirle a un LLM que resumiera un documento en segundos, pero preguntarle qué pasó en el minuto 14:32 de un video de dos horas? Imposible. El equipo fundador, con raíces en investigación de visión por computadora y experiencia en empresas como Google y Samsung, reconoció que la comprensión de video requería un enfoque fundamentalmente diferente de simplemente adjuntar reconocimiento de imágenes a una línea de tiempo. Se propusieron construir modelos fundacionales multimodales que entienden video de forma nativa — tratando escenas visuales, audio, habla y texto en pantalla como un flujo unificado en lugar de canales separados cosidos después.
Pegasus y Marengo: El stack de productos
Los productos principales de Twelve Labs son Pegasus y Marengo, cada uno abordando una pieza diferente del problema de inteligencia de video. Marengo es su modelo de embedding de video — convierte contenido de video en representaciones vectoriales ricas que permiten búsqueda semántica en bibliotecas masivas de video. Puedes consultar "persona con chaqueta roja abriendo una puerta" en miles de horas de metraje y obtener resultados precisos a nivel de marca de tiempo, incluso si nadie etiquetó o subtituló ese momento. Pegasus es su modelo de generación de video a texto, capaz de resumir, describir y responder preguntas sobre contenido de video con una especificidad que los modelos visión-lenguaje genéricos luchan por igualar. Juntos, estos modelos impulsan una API que permite a los desarrolladores construir aplicaciones como gestión de activos de medios, monitoreo de cumplimiento, moderación de contenido y búsqueda de video educativo sin necesidad de construir su propio pipeline de ML de video desde cero.
Financiamiento y posición de mercado
La empresa levantó una Serie A de $50 millones en 2024 liderada por NEA y NVentures (el brazo de venture capital de NVIDIA), con participación de Index Ventures e inversionistas existentes. Esto llevó su financiamiento total a más de $70 millones. La inversión de NVIDIA fue particularmente significativa — señaló que el fabricante de GPUs veía la comprensión de video como un segmento de mercado distinto y de alto valor en el que valía la pena apostar, no sólo una funcionalidad que eventualmente sería absorbida por modelos multimodales de propósito general de OpenAI o Google. Twelve Labs ha sido deliberada al posicionarse como infraestructura, no como una aplicación de usuario final. Su enfoque API-first significa que no compiten con sus clientes; son la tubería que hace posibles las aplicaciones de IA nativas de video en todas las industrias, desde medios y entretenimiento hasta seguridad y salud.
La brecha en comprensión de video
La razón por la que Twelve Labs tiene espacio para existir en un mercado dominado por laboratorios generalistas bien financiados es que el video es genuinamente difícil. Una sola hora de video a 30 cuadros por segundo contiene 108,000 imágenes, más audio, habla, superposiciones de texto y relaciones temporales entre todo ello. Los modelos multimodales de propósito general como GPT-4o y Gemini pueden procesar clips de video cortos, pero les cuesta con la escala, precisión y velocidad que las aplicaciones de video en producción demandan. La arquitectura construida a propósito de Twelve Labs está diseñada exactamente para este problema: indexación rápida de bibliotecas masivas de video, búsqueda en menos de un segundo en cientos de miles de horas, y tareas de generación que requieren entender lo que sucedió a través del tiempo, no sólo en un cuadro individual. A medida que el video continúa dominando el tráfico de internet y los datos empresariales — Cisco estima que el video representará el 82% de todo el tráfico IP — las empresas que puedan hacer ese contenido buscable y accionable serán dueñas de una pieza únicamente valiosa del stack de IA.