A Black Forest Labs apresentou o FLUX 3 em 23 de julho, e a parte notavel não e a qualidade das imagens. Trata-se de um único modelo multimodal treinado conjuntamente em imagem, video, audio e previsão de ação, dentro de uma arquitetura unificada, vindo de uma empresa mais conhecida por criar os modelos de imagem que alimentam recursos generativos no Adobe Photoshop, no Picsart e em outras ferramentas criativas.
O enquadramento e deliberadamente maior do que a geração de imagens. A empresa descreve o FLUX 3 como um passo rumo a modelos de mundo real, sistemas que constroem uma única representação do mundo aprendendo com imagens, video e audio em conjunto, em vez de dominar uma modalidade por vez. O método subjacente, que ela chama de Self-Flow, busca alinhar geração e compreensao multimodais dentro da mesma arquitetura, de modo que gerar e interpretar não sejam duas pilhas separadas parafusadas uma na outra.
A previsão de ação e a peça que muda o tipo de empresa que essa companhia e. Um modelo que preve ações a partir de video não e uma ferramenta criativa, e um componente de robótica, e a Black Forest Labs esta entregando isso por meio de parceiros selecionados de pesquisa e comerciais, comecando pela mimic robotics, que apresentou um modelo de ação por video baseado em FLUX no chão de fabrica da Audi. Um laboratório de imagem cruzando para a IA incorporada e um movimento real, não um slide de apresentação.
O lançamento e escalonado e apenas parcialmente aberto. O FLUX 3 esta em acesso antecipado agora. Geração e edição de video e audio, além de síntese e edição de imagem, chegam por meio de APIs e de acesso privado aos pesos, a previsão de ação vem por parceiros, e a empresa diz que também vai liberar acesso a pesos abertos de um backbone multimodal para criação de conteudo e previsão de ação. Quanto da fronteira acabara sendo baixável, e sob qual licença, e a pergunta que vai decidir como a comunidade de modelos abertos vai receber isso.
A direção e o que importa. A fronteira da IA visual generativa esta saindo da produção de imagens mais bonitas rumo a um único modelo que percebe, gera e age, e os laboratórios que começaram em imagem agora disputam o mesmo terreno com laboratórios de robótica e equipes de modelos de video. O FLUX 3 e uma das declarações mais claras ate agora de que essas trilhas estão convergindo.
