Black Forest Labs a presente FLUX 3 le 23 juillet, et l'element notable n'est pas la qualite des images. Il s'agit d'un seul modele multimodal entraine conjointement sur l'image, la video, l'audio et la prediction d'action, a l'interieur d'une architecture unifiee, de la part d'une entreprise surtout connue pour avoir fabrique les modeles d'image qui alimentent les fonctions generatives d'Adobe Photoshop, de Picsart et d'autres outils creatifs.
Le cadrage est deliberement plus large que la generation d'images. L'entreprise decrit FLUX 3 comme une etape vers des modeles du monde reel, des systemes qui construisent une representation unique du monde en apprenant a la fois des images, de la video et de l'audio, plutot qu'en maitrisant une modalite a la fois. La methode sous-jacente, qu'elle appelle Self-Flow, vise a aligner la generation et la comprehension multimodales au sein de la meme architecture, de sorte que generer et interpreter ne soient pas deux piles distinctes boulonnees l'une a l'autre.
La prediction d'action est la piece qui change la nature meme de cette entreprise. Un modele qui predit des actions a partir de la video n'est pas un outil creatif, c'est une composante robotique, et Black Forest Labs la livre par l'entremise de partenaires de recherche et commerciaux selectionnes, a commencer par mimic robotics, qui a mis en service un modele video-action fonde sur FLUX sur le plancher d'usine chez Audi. Un laboratoire d'imagerie qui bascule vers l'IA incarnee, c'est un vrai geste, pas une diapositive de presentation.
Le deploiement est etage et seulement partiellement ouvert. FLUX 3 est en acces anticipe des maintenant. La generation et l'edition video et audio, ainsi que la synthese et l'edition d'images, arrivent par des API et un acces en poids prives, la prediction d'action passe par des partenaires, et l'entreprise dit qu'elle publiera aussi un acces en poids ouverts a une ossature multimodale pour la creation de contenu et la prediction d'action. Quelle part de la frontiere finira telechargeable, et sous quelle licence, voila la question qui decidera de l'accueil que la communaute des modeles ouverts reservera a tout ceci.
C'est la direction qui compte. La frontiere de l'IA visuelle generative passe de la production d'images plus jolies a un modele unique qui percoit, genere et agit, et les laboratoires qui ont commence dans l'image se disputent desormais le meme terrain que les laboratoires de robotique et les equipes de modeles video. FLUX 3 est l'une des affirmations les plus claires a ce jour que ces trajectoires convergent.
