Black Forest Labs 於 7 月 23 日發表 FLUX 3,一個同時面向影像、影片、音訊與機器人動作的單一模型,並把 FLUX 3 Video 放在需要申請的門檻之後,首日沒有 API 存取。這道門檻現在已經消失。該公司的模型頁面如今寫明,FLUX 3 Video 可透過控制台與 API 依用量付費使用,並附有公開價目表,這正是一次研究發布變成任何開發者都能接進流程的產品的時刻。

這個影片模型一次生成最長 20 秒的片段,支援 HD(每格最高一百萬畫素)或 FHD(每格最高兩百萬畫素),並自帶原生音訊:多語言對白、與畫面同步的語音、音效與環境聲,全部不另收費。API 提供四種入口。文生影片與圖生影片是最直接的兩種。關鍵影格生影片最多接收十張靜態圖片,並為它們之間的轉場生成動畫,分鏡稿就是這樣變成一段連續畫面的。影片續寫每次把既有片段延長五到十五秒,更長的作品因此靠串接完成。草稿模式生成更快、更便宜的 HD 預覽,鏡頭通過後再增強到完整的 FHD,這比早期工具「生成然後祈禱」的循環更接近工作室的真實流程。

價格按輸出的每一秒計算。文生影片與圖生影片在草稿 HD 為每秒 0.06 美元,標準 HD 為 0.17 美元,標準 FHD 為 0.29 美元。續寫影片更貴,同樣三檔分別為每秒 0.12、0.41 與 0.53 美元。Black Forest Labs 自己給出的例子是,一段由文字生成的五秒標準 HD 片段花費 0.85 美元。作為對比,FHD 下 20 秒的上限在任何重試之前略低於六美元。

發表時的論點是,只從影像學習的模型只能生成影像。執行長 Robin Rombach 在 7 月對 VentureBeat 說:「你無法欺騙現實。」該公司還把同一個骨幹網路用在機器人變體 FLUX-mimic 上,奧迪表示它已在其生產線上運作,處理柔性物體的操作。家族的其餘部分仍在分階段推進:FLUX 3 Image、FLUX 3 Action 與開放權重的 FLUX 3 Dev 骨幹被列為發布計畫的獨立部分,影像模型尚未進入公開 API。Canva、Burda、Magnific、Krea 與 Picsart 在發表時被列為測試夥伴。

Zubnet 今天把 FLUX 3 Video 加入了自己的平台,提供同樣的三檔按秒計價、草稿模式、關鍵影格與續寫,並按實際返回片段的長度計費,而不是按請求的長度。