A Black Forest Labs apresentou o FLUX 3 em 23 de julho, e a parte notavel nao e a qualidade das imagens. Trata-se de um unico modelo multimodal treinado conjuntamente em imagem, video, audio e previsao de acao, dentro de uma arquitetura unificada, vindo de uma empresa mais conhecida por criar os modelos de imagem que alimentam recursos generativos no Adobe Photoshop, no Picsart e em outras ferramentas criativas.
O enquadramento e deliberadamente maior do que a geracao de imagens. A empresa descreve o FLUX 3 como um passo rumo a modelos de mundo real, sistemas que constroem uma unica representacao do mundo aprendendo com imagens, video e audio em conjunto, em vez de dominar uma modalidade por vez. O metodo subjacente, que ela chama de Self-Flow, busca alinhar geracao e compreensao multimodais dentro da mesma arquitetura, de modo que gerar e interpretar nao sejam duas pilhas separadas parafusadas uma na outra.
A previsao de acao e a peca que muda o tipo de empresa que essa companhia e. Um modelo que preve acoes a partir de video nao e uma ferramenta criativa, e um componente de robotica, e a Black Forest Labs esta entregando isso por meio de parceiros selecionados de pesquisa e comerciais, comecando pela mimic robotics, que apresentou um modelo de acao por video baseado em FLUX no chao de fabrica da Audi. Um laboratorio de imagem cruzando para a IA incorporada e um movimento real, nao um slide de apresentacao.
O lancamento e escalonado e apenas parcialmente aberto. O FLUX 3 esta em acesso antecipado agora. Geracao e edicao de video e audio, alem de sintese e edicao de imagem, chegam por meio de APIs e de acesso privado aos pesos, a previsao de acao vem por parceiros, e a empresa diz que tambem vai liberar acesso a pesos abertos de um backbone multimodal para criacao de conteudo e previsao de acao. Quanto da fronteira acabara sendo baixavel, e sob qual licenca, e a pergunta que vai decidir como a comunidade de modelos abertos vai receber isso.
A direcao e o que importa. A fronteira da IA visual generativa esta saindo da producao de imagens mais bonitas rumo a um unico modelo que percebe, gera e age, e os laboratorios que comecaram em imagem agora disputam o mesmo terreno com laboratorios de robotica e equipes de modelos de video. O FLUX 3 e uma das declaracoes mais claras ate agora de que essas trilhas estao convergindo.
