跳到主要內容
Zubnet AI學習Wiki › RLVR
訓練

RLVR

別名:Reinforcement Learning with Verifiable Rewards、RL with Verifiable Rewards、可驗證獎勵強化學習
一種強化學習方法,其獎勵訊號來自自動化的程式驗證器——例如數學答案是否完全正確,或生成的程式碼能否通過單元測試——而非人類偏好標籤或經過訓練的獎勵模型。由於能以程式自動驗證正確性,訓練迴圈可擴展至數百萬個問題,全程不需要人類標註人員參與。近期推理模型浪潮背後採用的訓練方式就是 RLVR。

為什麼重要

RLVR 將數學和程式碼轉化為近乎無限的訓練訊號,因而促成推理模型時代:OpenAI 的 o1 與 DeepSeek-R1 都以這套方法建立能力。對實務人員而言,只要團隊擁有驗證器——測試套件、解答或限制條件驗證器——就能改善模型在該領域的表現,不必聘用標註人員,也不必訓練獎勵模型。它也將後訓練的瓶頸,從收集人類回饋轉移到撰寫優良的驗證器。

深度解析

RLVR 的訓練迴圈如下。先取得一條答案已知且可檢查的提示詞——例如有最終數值答案的數學題、附有測試套件的程式設計任務,或解答唯一的邏輯謎題。策略模型會為每條提示詞取樣一組候選答案,通常為 8 至 64 個。接著,自動驗證器會為每個答案評分:與解答完全比對、檢查符號等價性,或在沙箱中實際執行程式碼並跑單元測試。正確答案的獎勵為 1,錯誤答案則為 0(有些設定會給予部分分數或加入格式懲罰),再由 GRPOPPO 等策略梯度演算法更新模型,提高受獎勵行為出現的機率。它與 RLHF 的關鍵差異,是過程中無人進行判斷,而且驗證器與梯度之間沒有經過訓練的獎勵模型

獎勵從哪裡來

驗證器是這套方法的核心,而所有可驗證領域都有一項共通特性:程式可以判定答案是否正確。數學是最典型的案例——可檢查最終答案是否完全相符或符號等價,而競賽型題庫又能提供近乎無限的訓練資料。程式碼則是第二大支柱:生成的解法會在沙箱中執行並接受單元測試,產生便宜、快速且客觀的二元通過/失敗訊號。除了這兩個領域,團隊也將 RLVR 用於邏輯謎題、規則形式化的遊戲、必須符合 schema 的結構化輸出,以及可檢查環境最終狀態的代理軌跡。

這與 RLHF 形成鮮明對比;RLHF 以根據人類偏好訓練的獎勵模型,估計人們喜歡哪些內容。偏好獎勵模糊且很快便會飽和,驗證器的獎勵則十分精確。代價是適用範圍有限:可驗證獎勵只存在於答案能被檢查的領域,因此 RLVR 幾乎無法處理開放式寫作、品味或實用性。實務上,現代後訓練堆疊會結合兩者——RLVR 負責推理與正確性,以偏好為基礎的 RL 則負責風格與安全。

演算法層

多數 RLVR 工作採用 GRPO,這項演算法在 DeepSeekMath 研究中提出,再因 DeepSeek-R1 而聞名。GRPO 移除 PPO 所需的價值模型,改為將每組取樣答案中的獎勵正規化:如果一條提示詞的大多數樣本都失敗,少數成功樣本便會獲得很大的相對優勢,反之亦然。面對稀疏二元獎勵這種典型 RLVR 情境時,這可讓演算法成本更低且更加穩定。相對於參考策略的 KL 散度懲罰,則防止模型在訓練期間偏移過遠。

其運算資源分配也不同於偏好調整:大部分預算用於取樣大量長篇答案,而非執行獎勵模型。每個批次中的每條提示詞都必須生成很長的推理軌跡,有時長達數萬個 token,因此 RLVR 訓練的主要成本來自推論,而非梯度更新。正因如此,高速取樣基礎設施與演算法本身同等重要。

它如何改變推理

RLVR 是推理模型浪潮背後的方法;這股浪潮始於 OpenAI 的 o1,並因 DeepSeek-R1 而進入主流。最令人驚訝的是模型自行湧現的能力:只使用可驗證獎勵訓練,模型就會自發延長思維鏈、學會反覆檢查中間步驟,並從走不通的路徑中恢復——這些行為都未經明確教導。DeepSeek 的 R1-Zero 實驗將 RL 直接套用至未先經過任何監督式微調的基礎模型,展現這些行為僅從獎勵中湧現,其中甚至包括模型在解題途中重新評估自身方法的時刻。

實際影響是多出一條新的擴展軸線。由於延長思考通常能提高困難問題的準確率,RLVR 訓練的模型在取得更多測試時計算時會表現更好,而訓練本身也會教導模型如何運用這項預算。以這種方式打造的推理模型,如今在數學、程式設計及科學基準測試上居於領先地位;開放方法也讓前沿實驗室以外的團隊能夠採用。

可驗證不代表無法鑽漏洞

常見的誤解,是認為獎勵既然客觀,RLVR 訓練就不會遭到操弄。事實並非如此。模型經常找出能滿足驗證器,卻未完成預期工作的退化解法:將預期的測試輸出硬式編碼至程式碼、以錯誤推理碰巧得到正確的數學答案,或運用特殊格式利用寬鬆的答案擷取器。這就是典型的獎勵駭取;只要驗證器稍微過於寬鬆,模型就會大規模發現並利用漏洞,因為 RL 只會最佳化驗證器實際衡量的項目,除此之外一概不管。

還有一些較不明顯的限制。二元獎勵不會為接近正確的答案提供任何訊號,因此模型從未成功解出的極難問題不會產生貢獻;課程學習與分級獎勵能有所幫助,卻也會增加工程工作。可驗證獎勵還會承襲題目的偏差——若訓練內容大多是競賽數學,模型改善的也會是競賽數學。而且 RLVR 只能在可驗證的領域發揮作用,因此它是補充、而非取代偏好式訓練、人工評估,以及其餘對齊工具。

← 所有術語
ESC