Black Forest Labs 于 7 月 23 日发布了 FLUX 3,而其中值得关注的并不是图像质量。它是一个单一的多模态模型,在统一架构内对图像、视频、音频和动作预测进行联合训练。这家公司此前最为人所知的,是打造了为 Adobe Photoshop、Picsart 等创意工具中的生成式功能提供支持的图像模型。
这一定位刻意超出了图像生成的范畴。公司将 FLUX 3 描述为迈向真实世界模型的一步,这类系统通过同时学习图像、视频和音频来构建对世界的单一表征,而不是一次只精通一种模态。其底层方法被称为 Self-Flow,目标是在同一架构内对齐多模态的生成与理解,使生成和解读不再是两套硬拼在一起的独立堆栈。
动作预测才是改变这家公司性质的那一块。一个从视频中预测动作的模型不是创意工具,而是机器人组件。Black Forest Labs 正通过精选的研究与商业合作伙伴推出这一能力,首批合作方是 mimic robotics,后者已在奥迪的工厂车间部署了基于 FLUX 的视频动作模型。一家图像实验室跨入具身智能,这是实打实的动作,而不是演示文稿上的一页。
此次推出是分阶段的,而且只是部分开放。FLUX 3 目前处于早期访问阶段。视频与音频的生成和编辑、以及图像的合成与编辑,将通过 API 和私有权重访问提供,动作预测则通过合作伙伴提供;公司还表示,将面向内容创作和动作预测发布一个多模态骨干网络的开放权重访问。前沿能力最终有多少可供下载、以何种许可证发布,才是决定开源模型社区如何接纳它的关键问题。
真正重要的是方向。生成式视觉 AI 的前沿正在从生成更漂亮的图片,转向一个能够感知、生成并行动的模型,那些从图像起家的实验室,如今正与机器人实验室和视频模型团队争夺同一片阵地。FLUX 3 是迄今为止关于这几条赛道正在合流的最清晰宣示之一。
