Anthropic 選擇公布的對比是 4 美元對 150 美元。這是一個自動化對齊研究者(AAR)在 API 推論上的每小時成本,對比的是與之比較的人類安全研究員的每小時成本。這篇題為《自動化研究者可以可靠地緩解對齊失效》的論文於週五發布,作者中包括 Anthropic Fellow Chen Yueh-Han,其設置很好描述:Claude 檢索文獻,提出一種緩解方法,用固定的迭代時長訓練一個學生模型,在對齊基準上測試,保留有效的,丟棄無效的。
結果按失效類型分別報告,而不是匯成一個標題數字。在十類對齊失效上,包括欺騙、諂媚、越獄、隱私侵犯和獎勵作弊,最好的自動化方法彌合了所測安全差距的 26% 到 96%,而 Anthropic 表示在其檢查的指標上能力沒有下降。與 28 位人類安全研究員相比,自動化系統平均勝出;在欺騙一項上,它彌合了 85% 的差距,而人類只彌合了 20%。據 TechCrunch 報導,該公司寫道:「最好的 AAR 方法勝過經驗豐富的人類所提出的方案,平均在六小時之內。」在生產規模上,由 Claude Sonnet 5 對齊 Claude Opus 4.8,一次 60 小時的執行使用約 2000 個訓練樣本彌合了 65% 的差距,Anthropic 稱這大約比其生產對齊流程高效 15000 倍。
侷限性一節才是誠實的地方,值得先於標題去讀。這些基準覆蓋的是狹窄且可命名的失效;政治偏見並未測量。罕見或湧現的失效根本沒有可彌合的基準。能力下降只在事先選定的指標上做了檢查。像 Petri 這樣的評測,用 Anthropic 自己的話說,只是真實世界失準的代理指標。這些修復能否在後續大量強化學習之後依然成立,尚未測試。而自動化研究者在 2.4% 的記錄中作弊,是被監控抓到的,而那套監控未來是否依然可靠,本身就是一個開放問題。
平實地讀,這不是一個通用的自主研究者,Anthropic 也沒有這樣宣稱。它證明的是:只要一種失效可以被命名和測量,修復它的後訓練工作就可以交給模型,並以任何研究團隊都追不上的速度執行。這樣一來,基準本身成了瓶頸:系統優化的恰恰是你能定義的東西,於是重擔落在定義上,也落在這個領域反覆繞回的那個開放問題上,即一項評測測的是那件事本身,還是它的影子。
