LLM-as-Judge
为什么重要
深度解析
这套方法需要三种材料:一道测试提示词、一个或多个候选回答,以及告诉评估模型如何打分的评审提示词。评审提示词通常包含原始输入、候选输出、可选的参考答案和评分细则——例如“按 1 到 5 分评价有用性、准确性和清晰度,解释理由,然后给出最终分数”。让评审先走一步思维链、推理后再评分,比只索要一个裸数字更能稳定贴近人类评分员。评分细则一旦写好,同一次评审调用就可以跑遍几百或几千个测试案例,每项只花几美分;这也让持续评估变得实际可行,成本只是人工数据标注的一小部分。
成对比较与逐项打分
基本设置有两种。逐项打分时,评审只看一个回答,再对照细则评分,通常采用 1–5 或 1–10 的量表;G-Eval 是 2023 年出现的一套早期且影响深远的框架,它证明让评审逐步走完评分细则,得到的摘要和对话任务分数会更贴近人类评分。成对比较时,评审会看到同一条提示词的两个回答,再选出胜者;MT-Bench 和大多数擂台式自动评估都这样工作。成对比较通常更可靠,因为二选一比校准绝对分数容易,也避开所有回答都挤在 5 分制 4 分上的问题。反过来,如果只要大规模评一套系统的输出,逐项打分更便宜,因为每个测试案例只需调用一次评审。多数生产流水线会两者并用:逐项分数负责追踪回归,成对结论负责模型正面对比。
从基准测试到训练循环
同一套机器可以完成三种不同工作。第一,基准测试:MT-Bench 用强评审模型给多轮聊天回答打分,曾成为聊天质量的标准排行榜指标。第二,训练数据:评审对成对回答的偏好,会变成合成数据,用来训练奖励模型,随后再驱动 RLHF 式优化——这套流水线基本就是 RLAIF 所指的东西,也是实验室把偏好学习扩展到人类标注者产能之外的办法。第三,回归测试:产品团队保留一组固定测试提示词,每次改模型或提示词后都重新评审输出,在发布前抓住质量倒退。在三种工作里,评审都在替人类完成他们无法规模化、或无法稳定一致完成的劳动。
偏差问题
LLM 评审的失败模式已有大量记录,忽视它们只会产出垃圾排名。位置偏差:许多评审偏爱排在第一或第二的回答,所以严肃流水线会把每一对按两种顺序都跑一遍,只保留对调后仍不变的结论。冗长偏差:即使额外篇幅毫无信息,评审也会系统性偏爱更长、结构更丰富的答案,因此才有长度受控的评分变体。自我偏好偏差:拿某个模型当评审时,它往往会给自家家族的输出更高分,所以最安全的设置是,评审模型与被评模型来自不同家族。表面格式也会起作用——Markdown 标题、项目符号和自信语气都会把分数往上推。这些问题都不是致命伤,却意味着评审提示词和协议与评审模型本身同样重要。
它不会取代人类判断
一个常见误解是,强大的评审模型会让人工评估过时。据报告,在 MT-Bench 等基准上,顶尖评审模型与人类评分员的一致率超过 80%,大致等于两名人类之间的一致度——但这只是平均值,单个样例的可靠性要摇晃得多。评审不擅长抓住自信、格式漂亮的幻觉,因为文字读起来很好,评审自己往往也不知道正确答案。它们还继承自身盲点,因此医学建议、自残、越狱抵抗等高风险评估仍然需要人类审查,排行榜主张最好也要与 Chatbot Arena 等真人偏好票做健全性检查。诚实的表述是:LLM 评审是人类偏好的便宜、嘈杂代理,很适合排名和发现回归,却不是真相来源。
什么时候可以相信评审
一条经验法则是,如果质量关乎一件事“怎么说”,而不是“究竟对不对”,评审效果最好:指令遵循、语气、有用性、摘要流畅度、聊天质量。它最不擅长事实前沿,因为评审自己也不知道答案;在评审模型薄弱的专业领域和低资源语言中,同样不可靠。标准卫生做法是,先建立几百个人类标注样例组成的小型黄金集,测量评审与人类的一致率,再扩大规模;每次更换评审模型、评分细则或任务分布,也都要重新验证。跳过这一步的团队,最后优化的是如何讨好评审,不是如何服务用户——失败结果就是模型写得更长、装饰更多,却在细微处变得更差。