最重要的数字是 2840 亿:DeepSeek V4 Flash 混合专家骨干中的参数量,其中任何单个提示只激活约 130 亿。这个骨干正是 V4 Flash Vision Exp 的基础,DeepSeek 周五在其付费开发者平台上推出的多模态智能体模型。"Exp" 后缀很诚实:公司没有为新模型公布任何架构说明,其惯例的开放权重发布也未获确认,对一家发布通常以 checkpoint 打头的实验室来说是显著的反转。
厂商的基准表很具体。对比自家前身,Vision Exp 在七项文本基准中赢下六项,唯一的败绩在 Cybergym,该套件衡量软件漏洞发现能力。提升集中在名字所指之处:四项视觉基准中,该模型在其中两项上比 V4 Flash 提高超过 10%;据 SiliconANGLE 报道,它在 ALE 上还击败了 Anthropic 的 Opus 4.8,ALE 包含 1000 多个多步任务,要求与应用交互、编写代码并解读媒体内容;ZeroBench 则是 100 道专为前沿模型设计的高难度图像分析题。这些都还没有经过独立评估,在第三方跑分出现之前,请把这些图表当作厂商主张来看待。
底层是 4 月 V4 Flash 模型卡记录过的工程:HCA 与 CSA 两种 KV 缓存压缩技术,把百万 token 提示所需的算力削减约四分之三;在 32 万亿 token 上训练;并用 Muon 优化器加速隐藏层校准。DeepSeek 更大的 V4 Pro 参数量是其五倍多,如果 Vision Exp 的路子成立,它显然是接受同样视觉改造的下一个候选。
对开发者来说,故事的主线是 computer-use 智能体的性价比走向。来自 DeepSeek 这种成本结构的读屏智能体模型,冲击了"严肃的视觉智能体工作必须掏旗舰预算"的假设;Canaltech 的报道描述的正是这个用例:看着屏幕完成任务。值得盯住两件事:独立基准能否证实与 Opus 4.8 的对比,以及权重是否会跟进,因为一个可下载的、激活参数 130 亿的读屏模型,将在 Muse Glimmer 和 Qwen 3.8 之后仅两周,再次撬动本地智能体档位。
