我們未能報導的那次發布:Anthropic 在 7 月 24 日週五推出 Claude Opus 5,最重要的數字是二,即它與所跟隨的旗艦之間的價格倍數。Anthropic 自己的定位是'以一半價格接近 Claude Fable 5 的前沿智能',與 Opus 4.8 同為每百萬輸入 token 5 美元、輸出 25 美元,另有兩倍價格換取約 2.5 倍速度的 Fast 模式。它現在是 Claude Max 的預設模型、Pro 上的最強模型,並於當天上線 AWS Bedrock,支援 100 萬 token 上下文。

官方宣稱的數字,來自 Anthropic 的發布文章:在 Frontier-Bench 和 GDPval-AA 上創下新紀錄;CursorBench 3.2 得分在 Fable 5 峰值的 0.5% 以內,而每任務成本減半;OSWorld 2.0 超過 Fable 5 的最好成績,成本僅為其三分之一多一點;ARC-AGI-3 被 Anthropic 描述為次優模型的三倍,在公開任務集上為 30.2%。獨立評估比行銷口徑更客氣:Artificial Analysis 的智慧指數讓它以 61 比 60 略勝 Fable 5,實際持平,而在其代理基準 AA-Briefcase 上則明顯領先,1,720 比 1,574,每任務成本低約 20%;Epoch 給它的軟體工程得分與 Fable 5 持平。Anthropic 還表示有意沒有在網路任務上訓練 Opus 5,它在該領域仍遠落後於 Mythos 5。Simon Willison 特別指出的一個發布細節是:在一個無法檢視機器零件圖紙的 Frontier-Bench 任務中,Opus 5 自己寫了一套電腦視覺管線,從原始像素中提取了幾何形狀。

回應只用了五天。7 月 29 日,OpenAI 發表'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark':GPT-5.6 Sol 在 OpenAI 自己對公開任務集的重跑中得 13.3%(官方排行榜為 7.8%),但只要打開 Responses API 的兩個設定就達到 38.3%,超過 Opus 5 的 30.2%。這兩個設定是 retained reasoning(在工具呼叫之間保留私有推理,而不是丟棄)和 compaction(對長上下文做摘要,而不是截斷)。同樣的模型權重,輸出 token 少了約六倍,分數接近三倍。ARC Prize 的 Francois Chollet 把界線畫在了爭論如今所在之處:為分數定製的框架出局,任何客戶都能打開的通用 API 設定有效,而只要設定和成本被清楚報告,OpenAI 的數字就成立。他也承認了公平性問題:官方框架丟棄了模型自己產生的推理,這是關於測試的選擇,不是關於權重的。

那麼,兩個數字都存檔吧。Opus 5 在一個每步之間丟棄其推理的框架下得到 30.2%,GPT-5.6 Sol 在一個不丟棄的框架下得到 38.3%,兩者都是真的,而它們描述的不是同一個測試。這個發布週可用的教訓不在於誰贏了,而是從今往後,每一個前沿基準成績都分成兩列到來:模型,以及圍繞它的鷹架,而第二列正在成為推動數字的那一列。當廠商向你引用一個分數時,第一個追問如今有了固定形狀:用什麼框架,又是誰的框架。