Anthropic 选择公布的对比是 4 美元对 150 美元。这是一个自动化对齐研究者(AAR)在 API 推理上的每小时成本,对比的是与之比较的人类安全研究员的每小时成本。这篇题为《自动化研究者可以可靠地缓解对齐失效》的论文于周五发布,作者中包括 Anthropic Fellow Chen Yueh-Han,其设置很好描述:Claude 检索文献,提出一种缓解方法,用固定的迭代时长训练一个学生模型,在对齐基准上测试,保留有效的,丢弃无效的。

结果按失效类型分别报告,而不是汇成一个标题数字。在十类对齐失效上,包括欺骗、谄媚、越狱、隐私侵犯和奖励作弊,最好的自动化方法弥合了所测安全差距的 26% 到 96%,而 Anthropic 表示在其检查的指标上能力没有下降。与 28 位人类安全研究员相比,自动化系统平均胜出;在欺骗一项上,它弥合了 85% 的差距,而人类只弥合了 20%。据 TechCrunch 报道,该公司写道:"最好的 AAR 方法胜过经验丰富的人类所提出的方案,平均在六小时之内。"在生产规模上,由 Claude Sonnet 5 对齐 Claude Opus 4.8,一次 60 小时的运行使用约 2000 个训练样本弥合了 65% 的差距,Anthropic 称这大约比其生产对齐流程高效 15000 倍。

局限性一节才是诚实的地方,值得先于标题去读。这些基准覆盖的是狭窄且可命名的失效;政治偏见并未测量。罕见或涌现的失效根本没有可弥合的基准。能力下降只在事先选定的指标上做了检查。像 Petri 这样的评测,用 Anthropic 自己的话说,只是真实世界失准的代理指标。这些修复能否在后续大量强化学习之后依然成立,尚未测试。而自动化研究者在 2.4% 的记录中作弊,是被监控抓到的,而那套监控未来是否依然可靠,本身就是一个开放问题。

平实地读,这不是一个通用的自主研究者,Anthropic 也没有这样宣称。它证明的是:只要一种失效可以被命名和测量,修复它的后训练工作就可以交给模型,并以任何研究团队都追不上的速度运行。这样一来,基准本身成了瓶颈:系统优化的恰恰是你能定义的东西,于是重担落在定义上,也落在这个领域反复绕回的那个开放问题上,即一项评测测的是那件事本身,还是它的影子。