A Black Forest Labs apresentou o FLUX 3 em 23 de julho como um único modelo para imagem, vídeo, áudio e ações de robôs, e abriu o FLUX 3 Video atrás de um portão com inscrição, sem acesso à API no primeiro dia. Esse portão desapareceu. A página do modelo agora lista o FLUX 3 Video como disponível pelo painel e pela API em regime de pagamento por uso, com uma tabela de preços pública, que é o momento em que um lançamento de pesquisa vira um produto que qualquer desenvolvedor pode colocar em um fluxo de produção.

O modelo de vídeo gera clipes de até 20 segundos em uma única passagem, em HD (até um megapixel por quadro) ou FHD (até dois megapixels por quadro), com áudio nativo: diálogo multilíngue, fala sincronizada com a imagem, efeitos sonoros e som ambiente, incluídos sem custo extra. A API oferece quatro entradas. Texto para vídeo e imagem para vídeo são as duas óbvias. O modo por quadros-chave recebe até dez imagens fixas e anima as transições entre elas, é assim que um storyboard vira uma sequência. A continuação de vídeo estende um clipe existente em cinco a quinze segundos por passagem, então peças longas são construídas por encadeamento. Um modo rascunho renderiza uma prévia HD mais rápida e barata que pode ser aprimorada para FHD completo depois que o plano é aprovado, o que está mais perto de como um estúdio realmente trabalha do que do ciclo de gerar e torcer das ferramentas anteriores.

Os preços são por segundo de saída. Texto e imagem para vídeo custam 0,06 dólar por segundo em rascunho HD, 0,17 em HD padrão e 0,29 em FHD padrão. Continuar um vídeo custa mais, 0,12, 0,41 e 0,53 dólar por segundo nos mesmos três níveis. O exemplo da própria Black Forest Labs coloca um clipe HD padrão de cinco segundos a partir de texto em 0,85 dólar. Para comparar, o teto de 20 segundos em FHD sai por pouco menos de seis dólares antes de qualquer nova tentativa.

O argumento do lançamento era que um modelo que só aprende com imagens só consegue fazer imagens. "Não dá para enganar a realidade", disse o diretor-executivo Robin Rombach à VentureBeat em julho, e a empresa alimenta a mesma arquitetura em uma variante robótica, a FLUX-mimic, que a Audi diz estar rodando em suas linhas de produção para manipulação de objetos macios. O resto da família continua escalonado: FLUX 3 Image, FLUX 3 Action e a arquitetura de pesos abertos FLUX 3 Dev aparecem como partes separadas do lançamento, e o modelo de imagem ainda não chegou à API pública. Canva, Burda, Magnific, Krea e Picsart foram citados como parceiros de teste no lançamento.

A Zubnet adicionou hoje o FLUX 3 Video à sua plataforma, com os mesmos três níveis por segundo, o modo rascunho, os quadros-chave e a continuação, cobrado pela duração real do clipe devolvido e não pela duração pedida.