最重要的数字是 0.14 美元:DeepSeek V4-Flash-0731 每百万输入 token 的价格,7 月 31 日在 Hugging Face 以免门槛 MIT 许可发布,输出每百万 0.28 美元,约为 V4-Pro 档收费的三分之一。基座是 2840 亿参数的混合专家模型,每 token 激活 130 亿,上下文窗口 100 万 token;模型卡上的 3040 亿数字包含了附带的 DSpark 投机解码草稿模块。官方口径是架构和规模与预览版一致,提升仅来自重新后训练。

独立测量,刻意很小:Simon Willison 通过 OpenRouter 跑了他标准的鹈鹕测试,默认推理强度下得到一只令人失望的鹈鹕,用他原话说,把推理开到高档后则好得多。Artificial Analysis 把该模型排在 MiniMax 的 M3(一个 4280 亿模型)之前,并称其可能是目前性价比最高的模型。DeepSeek 自己的基准表更大,读起来像营销;附在上面的有用警告来自 MarkTechPost:智能体分数对框架敏感,独立运行可能有出入。用本编辑部的速记法:被主张的很多,被测量的很少,而测量到的是有利的。以这个价格自己跑一遍依然便宜。

同日发布的 MiniMax H3 是本周的另一半。它是一个全模态视频模型,把文本、图像、视频和音频读作一个统一上下文,而它真正的差异化是原生立体声:音频是一等输入,你可以给它一段参考音频,让图像里的角色唱出来,它随视频直接输出立体声,而不是依赖单独的配音环节。输出为 2K、4 到 15 秒,仅整数时长。底层机制包括:一个把约 10 万 token 源材料蒸馏到 4 千的标注方案;一个它声称带来 4 倍有效序列长度增益的新 VAE;以及一个上下文内再生步骤,替代外挂式超分模块。

保留意见才是有用的部分。H3 目前只能通过 MiniMax 的 API 和 Hailuo 应用访问;开放权重承诺'在未来几天内'提供,截至发稿并不存在,而这正是本编辑部在交付前一律按零计值的那种承诺。价格主张是 MiniMax 自己的(2K 下不到主流模型的三分之一);第三方追踪给出的按量付费约为每秒 0.13 美元,属报道而非确认。而《南华早报》援引 Artificial Analysis 称,H3 在视频编辑上领先,在文生视频上落后于 Google 的 Gemini Omni Flash,在图生视频上位于 Seedance 2.0 之后。两个发布,一个模式:本周模型领域有意思的动作发生在边缘地带,开放权重和视频,而不是封闭的前沿。