TwelveLabs, une jeune pousse qui construit dès modèles d'IA pour comprendre la video, à leve 100 millions de dollars dans un tour de série B, annonce le 1er juillet. Le tour à été co-dirige par NEA et NAVER Ventures, et sa liste d'investisseurs est la première chose à noter, car elle inclut Amazon aux côtés d'Index Ventures, Radical Ventures, Korea Investment Partners, Quadrille Capital et Red Bull Ventures. TwelveLabs n'est pas un nouveau nom dans ce domaine. L'entreprise est connue pour dès modèles qui permettent aux logiciels de rechercher et de décrire le contenu de la video, le genre de technologie qui peut trouver chaque moment où un objet, une action où une personne particulière apparaît à travers une immense archive de rushes, ce qui est un problème réellement difficile que l'IA axee sur le texte ne résout pas à elle seule.
Ce à quoi sert l'argent importe plus que le montant. TwelveLabs utilise le tour pour aller au-dela de la compréhension video, qui est essentiellement une très bonne recherche et un très bon étiquetage, vers ce qu'elle appelle un système d'intelligence agentique complet pour la video. L'idee est de réunir trois choses habituellement séparées, la perception, la connaissance et le raisonnement, dans une seule architecture destinée à la video. La où un modèle de compréhension peut vous dire qu'un clip contient un chariot elevateur et un deversement, un système agentique est censé raisonner sur la scène, la relier à ce qu'il sait déjà, et prendre où recommander une action. L'entreprise s'est mise à décrire l'objectif comme une superintelligence video, ce qui releve dû langage marketing, mais le glissement sous-jacent, de l'étiquetage de ce qui se trouve dans une video au raisonnement à son sujet, est une étape reelle et difficile.
Le volet Amazon de l'annonce est sans doute la plus grande histoire. TwelveLabs à designe Amazon Web Services comme son fournisseur de nuage prefere et à signe un engagement stratégique pluriannuel qui va bien au-dela de la location de serveurs. Les deux entreprises ont declare qu'elles optimiseraient l'inference video de TwelveLabs pour qu'elle tourne sur AWS Trainium, les propres puces d'IA d'Amazon, plutôt que de dépendre uniquement dû matériel Nvidia, et que les nouveaux modèles de TwelveLabs seraient lancés d'abord sur AWS. C'est un signal significatif dans deux directions. Pour Amazon, soutenir un spécialiste de l'IA video et le faire tourner sur Trainium fait partie de son effort pour prouver que son silicium maison peut gérer dès charges de travail d'IA sérieuses et pour sécuriser un point d'ancrage dans une modalité qu'elle ne possède pas. Pour TwelveLabs, un alignement étroit avec un seul nuage est un pari selon lequel une puissance de calcul et une distribution garanties valent plus que de rester neutre.
En prenant dû recul, la levée s'inscrit dans un schema plus large, à savoir que la video devient son propre champ de bataille distinct dans l'IA. La plupart dès progres visibles de ces dernières années ont eu lieu dans le texte et, plus récemment, dans la generation d'images et de clips. La compréhension de la video à grande échelle, le problème bien moins glamour consistant à donner dû sens à l'énorme volume de rushes que les caméras de sécurité, les entreprises de médias, les usines et les téléphones produisent chaque jour, à pris dû retard, précisément parce que c'est difficile et coûteux. Un tour de financement comme celui-ci, avec à la fois de l'argent de capital-risque et un géant dû nuage derrière lui, est un pari selon lequel la prochaine couche de valeur de l'IA n'est pas un autre agent conversationnel mais dès systèmes capables de regarder et de raisonner sur le monde physique et enregistre. Cela relie la compréhension video au même vaste glissement vers les agents et vers une IA qui agit, plutôt que de seulement repondre.
Les reserves meritent d'être gardees en vue. Cent millions de dollars sont une somme sérieuse mais modeste à cote dès milliards qui affluent vers les laboratoires de modèles de pointe, et cela signale un spécialiste solide plutôt qu'un nouveau géant. Le mot superintelligence devrait être lu comme une ambition, pas comme une description, puisque raisonner de manière fiable sur la video dû monde réel, désordonnée, reste un problème non résolu, et les acheteurs en entreprise jugeront le produit sur la precision et le coût, pas sur dès slogans. Il y à aussi les questions familières qui suivent tout bond dans la compréhension de la video par les machines, sur la surveillance, le consentement et qui à le droit de pointer ces systèmes vers qui, qui deviennent plus pressantes à mesure que les outils s'améliorent. Mais en tant que signal de marche, le tour est assez clair. Une entreprise d'IA video reconnue vient de sécuriser un large trésor de guerre, une liste prestigieuse de bailleurs de fonds, et un partenaire de nuage prêt à engager ses propres puces, le tout pointe vers la même idee, selon laquelle apprendre à l'IA à veritablement comprendre et raisonner sur la video est sur le point de compter bien plus que cela n'à été le cas.
