开放权重模型首次登上主流AI视频排行榜的榜首。MiniMax H3是这家上海实验室Hailuo系列模型的继任者,在独立基准测试机构Artificial Analysis的视频编辑榜单上位列第一,领先所有闭源竞争对手。截至本周一,这一成绩有了实质支撑,因为该模型的权重现已公开可用。

根据Artificial Analysis截至7月31日的数据,H3在视频编辑类别中以1130分的Elo得分位居第一,该得分基于超过5000次盲测偏好比较。此外,该模型在文生视频类别中排名第二,在图生视频类别中排名第三。此前从未有开放权重模型在该机构的任何视频类别中登顶。上一个开放权重领先者LTX-2.3的成绩远远落后,这意味着H3从权重发布的那一刻起,就以明显优势成为最强的开放视频模型。

H3是一款拥有330亿参数的模型,具备真正意义上的多模态接口。单个提示可以将文本与最多九张参考图像、三段视频片段和三段音频片段组合使用,模型可生成时长4至15秒、每秒24帧并带有原生立体声的视频。它还支持基于自定义内容的微调,这对于希望在不同镜头中保持角色或风格一致的工作室而言尤为重要。

此次发布属于开放权重,而非开源,许可细则同样重要。MiniMax社区许可证将商业使用限制在年收入低于2000万美元的公司,而托管产品中的两个组件并未随之发布。2K分辨率模块和H3-Context-IR组件均不包含在内,因此通过ComfyUI进行的本地运行最高只能达到768p,用户还必须自行完成上下文准备工作。

发布时机凸显了视频赛道已变得何等拥挤。字节跳动(ByteDance)同日发布了Seedance 2.5,可生成内置音频的30秒视频片段,而各大实验室的闭源模型仍然主导着大多数视频排行榜。但文本模型领域已经证明,一旦开放权重版本冲到第一梯队,市场格局可以被多快地重塑,而H3正是视频生成走上同一条道路的首个证据。