A TwelveLabs, uma startup que constrói modelos de IA para a compreensão de vídeo, levantou 100 milhões de dólares em uma rodada Série B, anunciada em 1 de julho. A rodada foi coliderada pela NEA e pela NAVER Ventures, e sua lista de investidores é a primeira coisa que vale notar, porque inclui a Amazon ao lado de Index Ventures, Radical Ventures, Korea Investment Partners, Quadrille Capital e Red Bull Ventures. A TwelveLabs não é um nome novo nesse espaço. Ela é conhecida por modelos que permitem que softwares busquem e descrevam o conteúdo de vídeo, o tipo de tecnologia capaz de encontrar cada momento em que um objeto, ação ou pessoa em particular aparece em um enorme arquivo de filmagens, o que é um problema genuinamente difícil que a IA focada em texto não resolve por conta própria.

O propósito do dinheiro importa mais do que o valor. A TwelveLabs está usando a rodada para avançar além da compreensão de vídeo, que é essencialmente uma busca e marcação muito boas, rumo ao que ela chama de um sistema completo de inteligência de vídeo agêntica. A ideia é reunir três coisas que normalmente ficam separadas, percepção, conhecimento e raciocínio, em uma única arquitetura voltada ao vídeo. Enquanto um modelo de compreensão pode dizer que um clipe contém uma empilhadeira e um derramamento, um sistema agêntico deve raciocinar sobre a cena, conectá-la ao que já sabe e executar ou recomendar uma ação. A empresa passou a descrever o objetivo como superinteligência de vídeo, o que é linguagem de marketing, mas a mudança subjacente, de rotular o que há em um vídeo para raciocinar sobre ele, é um passo real e difícil.

O lado Amazon do anúncio é, sem dúvida, a história maior. A TwelveLabs nomeou a Amazon Web Services como seu provedor de nuvem preferencial e assinou um compromisso estratégico plurianual que vai bem além de alugar servidores. As duas empresas disseram que otimizariam a inferência de vídeo da TwelveLabs para rodar no AWS Trainium, os próprios chips de IA da Amazon, em vez de depender exclusivamente do hardware da Nvidia, e que novos modelos da TwelveLabs seriam lançados primeiro na AWS. Esse é um sinal significativo em duas direções. Para a Amazon, apoiar uma especialista em IA de vídeo e rodá-la no Trainium faz parte de seu esforço para provar que seu silício próprio pode dar conta de cargas de trabalho sérias de IA e para garantir um espaço em uma modalidade que ela não domina. Para a TwelveLabs, o alinhamento profundo com uma nuvem é uma aposta de que computação e distribuição garantidas valem mais do que permanecer neutra.

Dando um passo atrás, o aporte se encaixa em um padrão maior, que é o vídeo se tornando um campo de batalha distinto e próprio na IA. A maior parte do progresso visível dos últimos anos aconteceu em texto e, mais recentemente, na geração de imagens e clipes. A compreensão de vídeo em escala, o problema bem menos glamouroso de dar sentido ao enorme volume de filmagens que câmeras de segurança, empresas de mídia, fábricas e celulares produzem todos os dias, ficou para trás, justamente por ser difícil e cara. Uma rodada de financiamento como esta, com dinheiro de capital de risco e uma gigante da nuvem por trás, é uma aposta de que a próxima camada valiosa da IA não é mais um chatbot, mas sistemas capazes de observar e raciocinar sobre o mundo físico e gravado. Isso conecta a compreensão de vídeo à mesma ampla mudança rumo a agentes e a uma IA que age, em vez de apenas responder.

Vale manter as ressalvas em vista. Cem milhões de dólares é uma quantia séria, mas modesta ao lado dos bilhões que fluem para os laboratórios de modelos de fronteira, e sinaliza uma especialista forte, e não uma nova gigante. A palavra superinteligência deve ser lida como ambição, e não como descrição, já que raciocinar de forma confiável sobre vídeo bagunçado do mundo real ainda é um problema não resolvido, e os compradores corporativos julgarão o produto pela precisão e pelo custo, e não por slogans. Há também as perguntas familiares que acompanham qualquer salto em máquinas compreendendo vídeo, sobre vigilância, consentimento e quem pode apontar esses sistemas para quem, que se tornam mais urgentes à medida que as ferramentas melhoram. Mas, como sinal de mercado, a rodada é clara o suficiente. Uma reconhecida empresa de IA de vídeo acaba de garantir um grande cofre de guerra, uma lista de peso de investidores e um parceiro de nuvem disposto a comprometer seus próprios chips, tudo apontado para a mesma ideia, a de que ensinar a IA a realmente compreender e raciocinar sobre vídeo está prestes a importar muito mais do que já importou.