Black Forest Labs 於 7 月 23 日發表 FLUX 3,而值得注意的並不是影像品質。這是一款單一的多模態模型,在同一套統一架構之內,針對影像、影片、音訊與動作預測進行聯合訓練;這家公司最為人熟知的,是打造出驅動 Adobe Photoshop、Picsart 等創意工具生成功能的影像模型。
這樣的定位刻意大於影像生成本身。該公司將 FLUX 3 描述為邁向真實世界模型的一步,也就是透過同時從影像、影片與音訊中學習,建立起對世界的單一表徵,而不是一次只精通一種模態的系統。其底層方法被稱為 Self-Flow,目標是在同一架構內對齊多模態的生成與理解,讓生成與詮釋不再是兩套硬拼在一起的堆疊。
動作預測才是改變這家公司性質的部分。能從影片預測動作的模型並不是創意工具,而是機器人系統的元件,而 Black Forest Labs 正透過精選的研究與商業夥伴推出這項能力,首波合作對象是 mimic robotics,該公司已在 Audi 的工廠現場導入以 FLUX 為基礎的影片動作模型。一間影像實驗室跨入具身 AI,是真正的動作,而不是簡報上的一頁投影片。
這次推出採分階段進行,而且只有部分開放。FLUX 3 目前處於早期存取階段。影片與音訊的生成與編輯、以及影像的合成與編輯,將透過 API 與私有權重存取提供,動作預測則透過合作夥伴釋出;該公司並表示,也會針對內容創作與動作預測,釋出多模態骨幹模型的開放權重存取。前沿能力最終有多少可供下載、又以何種授權條款提供,將是決定開放模型社群如何看待這件事的關鍵問題。
真正重要的是方向。生成式視覺 AI 的前沿,正從產出更漂亮的圖片,轉向一款能夠感知、生成並行動的單一模型,而那些從影像起家的實驗室,如今正與機器人實驗室和影片模型團隊爭奪同一塊地盤。FLUX 3 是迄今為止最明確的宣示之一,顯示這些路線正在匯流。
