Black Forest Labs presento FLUX 3 el 23 de julio, y lo destacable no es la calidad de imagen. Es un unico modelo multimodal entrenado conjuntamente en imagen, video, audio y predicción de acciones, dentro de una arquitectura unificada, de parte de una empresa más conocida por fabricar los modelos de imagen que impulsan las funciones generativas de Adobe Photoshop, Picsart y otras herramientas creativas.
El planteamiento es deliberadamente más amplio que la generación de imágenes. La empresa describe FLUX 3 como un paso hacia los modelos del mundo real, sistemas que construyen una unica representación del mundo aprendiendo de imágenes, video y audio a la vez en lugar de dominar una modalidad tras otra. El metodo subyacente, al que llama Self-Flow, busca alinear la generación y la comprensión multimodales dentro de la misma arquitectura, de modo que generar e interpretar no sean dos pilas separadas atornilladas una a la otra.
La predicción de acciones es la pieza que cambia que tipo de empresa es esta. Un modelo que predice acciones a partir de video no es una herramienta creativa, es un componente de robótica, y Black Forest Labs lo esta distribuyendo a través de socios de investigación y comerciales seleccionados, empezando por mimic robotics, que ha presentado un modelo de video y acción basado en FLUX en la planta de fabricación de Audi. Que un laboratorio de imagen cruce hacia la IA encarnada es un movimiento real, no una diapositiva en una presentación.
El despliegue es escalonado y solo parcialmente abierto. FLUX 3 esta ahora en acceso anticipado. La generación y edición de video y audio, y la síntesis y edición de imagen, llegan a través de APIs y acceso a pesos privados; la predicción de acciones, a través de socios. La empresa dice que también liberara acceso de pesos abiertos a una estructura base multimodal para creación de contenido y predicción de acciones. Cuanto de la frontera acaba siendo descargable, y bajo que licencia, es la pregunta que decidira como recibe esto la comunidad de modelos abiertos.
Lo que importa es la dirección. La frontera de la IA visual generativa se esta desplazando de producir imágenes más bonitas hacia un unico modelo que percibe, genera y actúa, y los laboratorios que empezaron en imagen compiten ahora con laboratorios de robótica y equipos de modelos de video por el mismo terreno. FLUX 3 es una de las declaraciones más claras hasta ahora de que esas vías están convergiendo.
