Black Forest Labs presento FLUX 3 el 23 de julio, y lo destacable no es la calidad de imagen. Es un unico modelo multimodal entrenado conjuntamente en imagen, video, audio y prediccion de acciones, dentro de una arquitectura unificada, de parte de una empresa mas conocida por fabricar los modelos de imagen que impulsan las funciones generativas de Adobe Photoshop, Picsart y otras herramientas creativas.
El planteamiento es deliberadamente mas amplio que la generacion de imagenes. La empresa describe FLUX 3 como un paso hacia los modelos del mundo real, sistemas que construyen una unica representacion del mundo aprendiendo de imagenes, video y audio a la vez en lugar de dominar una modalidad tras otra. El metodo subyacente, al que llama Self-Flow, busca alinear la generacion y la comprension multimodales dentro de la misma arquitectura, de modo que generar e interpretar no sean dos pilas separadas atornilladas una a la otra.
La prediccion de acciones es la pieza que cambia que tipo de empresa es esta. Un modelo que predice acciones a partir de video no es una herramienta creativa, es un componente de robotica, y Black Forest Labs lo esta distribuyendo a traves de socios de investigacion y comerciales seleccionados, empezando por mimic robotics, que ha presentado un modelo de video y accion basado en FLUX en la planta de fabricacion de Audi. Que un laboratorio de imagen cruce hacia la IA encarnada es un movimiento real, no una diapositiva en una presentacion.
El despliegue es escalonado y solo parcialmente abierto. FLUX 3 esta ahora en acceso anticipado. La generacion y edicion de video y audio, y la sintesis y edicion de imagen, llegan a traves de APIs y acceso a pesos privados; la prediccion de acciones, a traves de socios. La empresa dice que tambien liberara acceso de pesos abiertos a una estructura base multimodal para creacion de contenido y prediccion de acciones. Cuanto de la frontera acaba siendo descargable, y bajo que licencia, es la pregunta que decidira como recibe esto la comunidad de modelos abiertos.
Lo que importa es la direccion. La frontera de la IA visual generativa se esta desplazando de producir imagenes mas bonitas hacia un unico modelo que percibe, genera y actua, y los laboratorios que empezaron en imagen compiten ahora con laboratorios de robotica y equipos de modelos de video por el mismo terreno. FLUX 3 es una de las declaraciones mas claras hasta ahora de que esas vias estan convergiendo.
