TwelveLabs, una startup que construye modelos de IA para entender el vídeo, ha recaudado 100 millones de dólares en una ronda de Serie B, anunciada el 1 de julio. La ronda fue co liderada por NEA y NAVER Ventures, y su lista de inversores es lo primero que vale la pena destacar, porque incluye a Amazon junto con Index Ventures, Radical Ventures, Korea Investment Partners, Quadrille Capital y Red Bull Ventures. TwelveLabs no es un nombre nuevo en este espacio. Es conocida por modelos que permiten a los programas buscar y describir el contenido del vídeo, el tipo de tecnología que puede encontrar cada momento en que aparece un objeto, una acción o una persona en particular a lo largo de un enorme archivo de metraje, lo cual es un problema genuinamente difícil que la IA centrada en texto no resuelve por sí sola.

Para qué sirve el dinero importa más que la cantidad. TwelveLabs usa la ronda para ir más allá de la comprensión de vídeo, que es esencialmente una búsqueda y un etiquetado muy buenos, hacia lo que llama un sistema de inteligencia de vídeo agéntica de pila completa. La idea es integrar tres cosas que suelen estar separadas, la percepción, el conocimiento y el razonamiento, en una sola arquitectura orientada al vídeo. Donde un modelo de comprensión puede decirte que un clip contiene una carretilla elevadora y un derrame, un sistema agéntico está pensado para razonar sobre la escena, conectarla con lo que ya sabe y tomar o recomendar una acción. La empresa ha empezado a describir el objetivo como superinteligencia de vídeo, que es lenguaje de marketing, pero el cambio subyacente, de etiquetar lo que hay en un vídeo a razonar sobre ello, es un paso real y difícil.

El lado de Amazon del anuncio es posiblemente la historia más importante. TwelveLabs nombró a Amazon Web Services como su proveedor de nube preferido y firmó un compromiso estratégico plurianual que va mucho más allá de alquilar servidores. Las dos empresas dijeron que optimizarían la inferencia de vídeo de TwelveLabs para ejecutarse en AWS Trainium, los propios chips de IA de Amazon, en lugar de depender únicamente del hardware de Nvidia, y que los nuevos modelos de TwelveLabs se lanzarían primero en AWS. Esa es una señal significativa en dos direcciones. Para Amazon, respaldar a un especialista en IA de vídeo y ejecutarlo en Trainium es parte de su esfuerzo por demostrar que su silicio propio puede manejar cargas de trabajo de IA serias y por asegurar un punto de apoyo en una modalidad que no posee. Para TwelveLabs, una alineación profunda con una sola nube es una apuesta a que el cómputo y la distribución garantizados valen más que mantenerse neutral.

Si se toma distancia, la recaudación encaja en un patrón más amplio, que es que el vídeo se está convirtiendo en su propio campo de batalla distinto en la IA. La mayor parte del progreso visible de los últimos años ha sido en texto y, más recientemente, en generar imágenes y clips. Entender el vídeo a escala, el problema mucho menos glamoroso de dar sentido al enorme volumen de metraje que las cámaras de seguridad, las empresas de medios, las fábricas y los teléfonos producen cada día, se ha quedado atrás, precisamente porque es difícil y costoso. Una ronda de financiación como esta, con dinero de capital de riesgo y un gigante de la nube detrás, es una apuesta a que la próxima capa valiosa de la IA no es otro chatbot sino sistemas que pueden observar y razonar sobre el mundo físico y grabado. Eso conecta la comprensión de vídeo con el mismo cambio amplio hacia los agentes y hacia una IA que actúa, en lugar de solo responder.

Vale la pena tener presentes las advertencias. Cien millones de dólares es una suma seria pero modesta al lado de los miles de millones que fluyen hacia los laboratorios de modelos de frontera, y señala un especialista fuerte más que un nuevo gigante. La palabra superinteligencia debe leerse como ambición, no como descripción, ya que razonar de forma fiable sobre el vídeo desordenado del mundo real sigue siendo un problema sin resolver, y los compradores empresariales juzgarán el producto por su precisión y su costo, no por esloganes. También están las preguntas familiares que siguen a cualquier salto en las máquinas que entienden el vídeo, sobre la vigilancia, el consentimiento y quién puede apuntar estos sistemas hacia quién, que se vuelven más urgentes a medida que las herramientas mejoran. Pero como señal de mercado la ronda es bastante clara. Una reconocida empresa de IA de vídeo acaba de asegurar un gran cofre de guerra, una lista de patrocinadores de primer nivel y un socio de nube dispuesto a comprometer sus propios chips, todo apuntando a la misma idea, que enseñar a la IA a entender y razonar de verdad sobre el vídeo está a punto de importar mucho más de lo que lo ha hecho.