跳到主要內容
Zubnet AI學習Wiki › LLM-as-Judge
訓練

LLM-as-Judge

別名:LLM Judge、LLM-as-a-Judge、LLM 評審
一種評估技術,使用大型語言模型為另一個模型(或自身)的輸出評分,而不依賴人類評分人員。評審會收到原始提示詞、一或兩個候選回答與評分規準,再傳回分數、偏好判定或評析。對於 BLEU、ROUGE 等字串重疊指標會失效的開放式生成,它已成為預設評估方法。

為什麼重要

人工評估是判斷開放式文字的黃金標準,但速度緩慢且成本高昂:一次嚴謹的評估可能耗時數週,花費數千美元。LLM 評審只需幾分鐘與數美元,就能做出數千項判斷,使團隊能實際評估每次提示詞變更、模型替換和候選發布版本。它還能大規模產生現代對齊訓練所需的偏好標籤。

深度解析

這套方法包含三項要素:測試提示詞、一或多個候選回答,以及告訴評估模型如何打分的評審提示詞。評審提示詞通常包含原始輸入、候選輸出、選用的參考答案與評分規準——例如「以 1 至 5 分評估實用性、準確性和清楚程度,說明推理過程,再給出最終分數」。要求評審先進行思維鏈推理再評分,相較於只要求一個數字,能更穩定地提高與人類評分人員的一致程度。評分規準寫好後,同一種評審呼叫就能套用於數百或數千個測試案例,每項只需花費幾美分;這使持續評估變得切實可行,成本僅為人工標註的一小部分。

成對比較與單項評分

基本設定有兩種。單項評分時,評審只查看一個回答並按照規準打分,通常採用 1–5 或 1–10 的量尺;早期且深具影響力的 2023 年框架 G-Eval 顯示,引導評審逐步遵循規準,可在摘要與對話任務上產生更貼近人類評分的分數。成對比較時,評審會查看同一提示詞的兩個回答並選出勝者,MT-Bench 與多數競技場式自動評估都採用這種方式。成對比較通常更可靠,因為在兩個候選答案中做選擇,比校準絕對分數容易,也能避開每個回答都得到 5 分制中 4 分的問題。另一方面,要大規模評量單一系統的輸出時,單項評分成本更低,因為每個測試案例只需呼叫一次評審。多數正式環境管線會同時採用兩者:單項分數用來追蹤品質退步,成對判定則用於模型間的一對一比較。

從基準測試到訓練迴圈

同一套機制可完成三種不同工作。第一是基準測試:MT-Bench 使用強大的評審模型為多輪聊天回答評分,並成為評量聊天品質的標準排行榜指標。第二是訓練資料:評審對成對回答的偏好會形成Synthetic Data(合成資料),用來訓練獎勵模型,再驅動 RLHF 式最佳化——這套管線基本上就是 RLAIF 的含義,也是實驗室將偏好學習規模擴大到人類標註人員產能之外的方法。第三是迴歸測試:產品團隊會保留一組固定測試提示詞,每當模型或提示詞變更時便重新評審輸出,以便在發布前找出品質退步。這三項工作都由評審完成難以由人類大規模處理,或難以穩定一致執行的任務。

偏誤問題

LLM 評審已有明確記錄的失敗模式,忽略這些問題會產生毫無價值的排名。位置偏誤:許多評審偏愛先出現(或後出現)的回答,因此嚴謹的管線會以兩種順序評估每組配對,只保留順序互換後仍相同的判定。冗長偏誤:即使增加的篇幅沒有提供任何內容,評審仍會系統性偏好更長、結構更完整的答案,因此出現了控制長度的評分變體。自我偏好偏誤:用作評審的模型,往往會為自家模型家族的輸出給出高於獨立評審的分數,因此最安全的設定,是採用與受評模型不同家族的評審模型。表面格式也會影響結果——Markdown 標題、項目符號清單和自信的語氣都會推高分數。這些問題都不致命,但代表評審提示詞與評估流程和評審模型本身同等重要。

它不會取代人類判斷

常見的誤解,是認為強大的評審模型會使人工評估過時。根據報告,在 MT-Bench 等基準測試上,頂尖評審模型與人類評分人員的一致率超過 80%,大致相當於兩名人類間的一致程度——但這只是平均值,個別範例的可靠性低得多。評審不擅長發現充滿自信且格式良好的幻覺,因為文字看來合理,而評審本身往往也不知道正確答案。評審也會承襲自身盲點,因此醫療建議、自傷與抗越獄能力等高風險評估仍需由人類審查;排行榜聲明也最好與 Chatbot Arena 等人類偏好投票互相比對,進行合理性檢查。坦白來說,LLM 評審是成本低廉但帶有雜訊的人類偏好替代指標,十分適合排名與偵測品質退步,卻不是真實答案的來源。

什麼時候可以相信評審

經驗法則是,當品質取決於內容「如何表達」,而非「是否完全正確」時,評審效果最佳:例如指令遵循、語氣、實用性、摘要流暢度與聊天品質。效果最差的情境則是事實知識的前沿,因為評審也不知道答案;評審模型能力薄弱的專業領域與低資源語言同樣不可靠。標準做法是建立一個由數百個人類標註範例組成的小型黃金資料集,在擴大規模前先測量評審與人類的一致程度;每當評審模型、評分規準或任務分布改變時,也要重新驗證。省略這個步驟的團隊,最後會將模型最佳化為討好評審,而非服務使用者——結果往往是回答更長、更花俏,卻在細節上變得更差。

← 所有術語
ESC