Black Forest Labs 于 7 月 23 日发布了 FLUX 3,一个同时面向图像、视频、音频和机器人动作的单一模型,并把 FLUX 3 Video 放在需要申请的门槛之后,首日没有 API 访问。这道门槛现在已经消失。该公司的模型页面如今写明,FLUX 3 Video 可通过控制台和 API 按量付费使用,并附有公开价目表,这正是一次研究发布变成任何开发者都能接入流水线的产品的时刻。

这个视频模型一次生成最长 20 秒的片段,支持 HD(每帧最高一百万像素)或 FHD(每帧最高两百万像素),并自带原生音频:多语言对白、与画面同步的语音、音效和环境声,全部不另收费。API 提供四种入口。文生视频和图生视频是最直接的两种。关键帧生视频最多接收十张静态图片,并为它们之间的过渡生成动画,分镜稿就是这样变成一段连续画面的。视频续写每次把已有片段延长五到十五秒,更长的作品因此靠串接完成。草稿模式生成更快、更便宜的 HD 预览,镜头通过后再增强到完整的 FHD,这比早期工具"生成然后祈祷"的循环更接近工作室的真实流程。

价格按输出的每一秒计算。文生视频和图生视频在草稿 HD 为每秒 0.06 美元,标准 HD 为 0.17 美元,标准 FHD 为 0.29 美元。续写视频更贵,同样三档分别为每秒 0.12、0.41 和 0.53 美元。Black Forest Labs 自己给出的例子是,一段由文本生成的五秒标准 HD 片段花费 0.85 美元。作为对比,FHD 下 20 秒的上限在任何重试之前略低于六美元。

发布时的论点是,只从图像学习的模型只能生成图像。首席执行官 Robin Rombach 在 7 月对 VentureBeat 说:"你无法欺骗现实。"该公司还把同一个骨干网络用在机器人变体 FLUX-mimic 上,奥迪表示它已在其生产线上运行,处理柔性物体的操作。家族的其余部分仍在分阶段推进:FLUX 3 Image、FLUX 3 Action 和开放权重的 FLUX 3 Dev 骨干被列为发布计划的独立部分,图像模型尚未进入公开 API。Canva、Burda、Magnific、Krea 和 Picsart 在发布时被列为测试伙伴。

Zubnet 今天把 FLUX 3 Video 加入了自己的平台,提供同样的三档按秒计价、草稿模式、关键帧和续写,并按实际返回片段的长度计费,而不是按请求的长度。