我们未能报道的那次发布:Anthropic 在 7 月 24 日周五推出 Claude Opus 5,最重要的数字是二,即它与所跟随的旗舰之间的价格倍数。Anthropic 自己的定位是'以一半价格接近 Claude Fable 5 的前沿智能',与 Opus 4.8 同为每百万输入 token 5 美元、输出 25 美元,另有两倍价格换取约 2.5 倍速度的 Fast 模式。它现在是 Claude Max 的默认模型、Pro 上的最强模型,并于当天上线 AWS Bedrock,支持 100 万 token 上下文。

官方宣称的数字,来自 Anthropic 的发布文章:在 Frontier-Bench 和 GDPval-AA 上创下新纪录;CursorBench 3.2 得分在 Fable 5 峰值的 0.5% 以内,而每任务成本减半;OSWorld 2.0 超过 Fable 5 的最好成绩,成本仅为其三分之一多一点;ARC-AGI-3 被 Anthropic 描述为次优模型的三倍,在公开任务集上为 30.2%。独立评估比营销口径更客气:Artificial Analysis 的智能指数让它以 61 比 60 略胜 Fable 5,实际持平,而在其智能体基准 AA-Briefcase 上则明显领先,1,720 比 1,574,每任务成本低约 20%;Epoch 给它的软件工程得分与 Fable 5 持平。Anthropic 还表示有意没有在网络任务上训练 Opus 5,它在该领域仍远落后于 Mythos 5。Simon Willison 特别指出的一个发布细节是:在一个无法查看机器零件图纸的 Frontier-Bench 任务中,Opus 5 自己写了一套计算机视觉流水线,从原始像素中提取了几何形状。

回应只用了五天。7 月 29 日,OpenAI 发表'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark':GPT-5.6 Sol 在 OpenAI 自己对公开任务集的重跑中得 13.3%(官方排行榜为 7.8%),但只要打开 Responses API 的两个设置就达到 38.3%,超过 Opus 5 的 30.2%。这两个设置是 retained reasoning(在工具调用之间保留私有推理,而不是丢弃)和 compaction(对长上下文做摘要,而不是截断)。同样的模型权重,输出 token 少了约六倍,分数接近三倍。ARC Prize 的 Francois Chollet 把界线画在了争论如今所在之处:为分数定制的框架出局,任何客户都能打开的通用 API 设置有效,而只要设置和成本被清楚报告,OpenAI 的数字就成立。他也承认了公平性问题:官方框架丢弃了模型自己产生的推理,这是关于测试的选择,不是关于权重的。

那么,两个数字都存档吧。Opus 5 在一个每步之间丢弃其推理的框架下得到 30.2%,GPT-5.6 Sol 在一个不丢弃的框架下得到 38.3%,两者都是真的,而它们描述的不是同一个测试。这个发布周可用的教训不在于谁赢了,而是从今往后,每一个前沿基准成绩都分成两列到来:模型,以及围绕它的脚手架,而第二列正在成为推动数字的那一列。当厂商向你引用一个分数时,第一个追问如今有了固定形状:用什么框架,又是谁的框架。