跳到主要內容
Zubnet AI學習Wiki › GRPO
訓練

GRPO

別名:Group Relative Policy Optimization、群體相對策略最佳化
一種用於微調語言模型的強化學習演算法,由 DeepSeek 於 2024 年提出,並因 DeepSeek-R1 而普及。它不訓練獨立的價值模型來評估輸出,而是針對每條提示詞取樣一組候選答案,再根據整組的平均獎勵為每個答案評分。這使強化學習的執行成本更低、流程更簡單,也成為使用可驗證獎勵任務進行推理模型後訓練時的標準選擇。

為什麼重要

GRPO 移除 critic 模型,降低了 RL 微調成本;這是傳統管線必須訓練並保留於記憶體中的兩個大型模型之一,使沒有前沿實驗室基礎設施的團隊也能進行推理式訓練。它是 DeepSeek-R1 背後的演算法,此後也為多數開放推理模型採用,因此如今幾乎所有嚴謹的後訓練堆疊都會使用 GRPO。若使用的模型曾接受數學、程式碼或邏輯問題的解題訓練,GRPO 很可能參與其中。

深度解析

GRPO——Group Relative Policy Optimization——最早見於 DeepSeek 在 2024 年發表的 DeepSeekMath 論文,一年後則因成為 DeepSeek-R1 背後的訓練演算法而廣為人知;這款開放模型證明,單靠強化學習即可引出長篇、能自我檢查的思維鏈。GRPO 的核心,是將 PPO 加以務實簡化,而 PPO 正是經典 RLHF 管線所採用的演算法。PPO 會訓練第二個大型模型,也就是 critic,用來估計只生成部分內容的答案有多好;GRPO 則完全捨棄 critic。針對每條提示詞,目前的策略會取樣一組候選輸出,每項輸出都會獲得獎勵,而各自的優勢就是其獎勵高於或低於整組平均值的程度。這形成一個成本較低、更容易調校,而且自然適合用可驗證獎勵訓練推理模型的 RL 迴圈。

群組如何取代 critic

在 PPO 中,critic 的工作是預測部分答案的預期獎勵,讓演算法判斷最終結果比預期更好或更差。GRPO 不使用神經網路,而以統計資料取得相同的基準線訊號。給定一條提示詞,策略會生成一組 G 個輸出——實務上介於 8 至 64 個——再為每項輸出評分;評分方式可以是規則式驗證器,例如數學答案是否相符、程式碼是否通過測試,也可以採用經過訓練的獎勵模型。每項輸出的優勢,是其獎勵減去群組平均值,再除以群組標準差。高於群組平均值的輸出會提高機率,低於平均值的輸出則降低機率;PPO 式裁剪目標函數加上朝凍結參考模型靠攏的 KL 懲罰,會將每次更新限制在小幅度內。由於基準線會針對每條提示詞計算,若某條提示詞的所有樣本得分均相同,幾乎不會產生任何梯度——這在實務上格外重要。

為什麼更便宜、更穩定

節省幅度十分具體。傳統 PPO 管線在訓練時要同時將四個模型放在記憶體中——策略、凍結參考策略、獎勵模型,以及通常與策略同樣大的 critic——而 critic 還必須與其他部分一同訓練,這個過程出了名地難以調校。GRPO 移除四者中最麻煩的一個,釋放VRAM以容納更大的批次或模型,也消除了一整類價值學習錯誤。群組正規化還能自動處理獎勵尺度:如果某條提示詞的獎勵高度集中,其優勢便會壓低至接近零,使更新集中在模型輸出品質確實有差異的提示詞上。代價是運算預算從訓練 critic 轉移到推論:每個步驟都要針對數千條提示詞各生成 16 或 32 個樣本,因此瓶頸通常是取樣器,而非最佳化器。

它是最佳化器,不是推理配方

常見的誤解,是以為 GRPO 本質上與推理或可驗證獎勵綁在一起——彷彿演算法本身造就了 DeepSeek-R1 中的行為。事實並非如此。GRPO 不限定獎勵類型:無論收到什麼訊號,它都會加以最大化,包括經過訓練的獎勵模型針對實用性、風格等開放式品質給出的分數。推理突破來自整套組合——GRPO 加上規則式可驗證獎勵、強大的基礎模型,以及長到足以讓自我驗證等行為湧現的訓練——這套方法如今稱為 RLVR。反過來說,可驗證獎勵搭配一般 PPO 也能順利運作,GRPO 出現之前已有數家實驗室以此方式訓練推理模型。實務上必須區分這兩個概念:如果團隊採用 GRPO,卻沒有精心設計獎勵或投入足夠運算資源,便期待推理能力自行從演算法湧現,通常只會失望。

它會在哪裡失靈

GRPO 的簡潔設計也伴隨一些值得了解的失敗模式。最常受到討論的是全有或全無的群組:如果一條提示詞的所有樣本獲得相同獎勵——全部正確或全部錯誤——每個優勢都會變成零,該提示詞也不會產生任何貢獻,因此訓練訊號高度仰賴提示詞難度維持在模型偶爾能成功的範圍。困難任務的獎勵稀疏會讓情況更加嚴重,因此實務管線會混入較容易的問題,或提供部分分數。群組太小會產生帶有雜訊的基準線;群組太大則需要更多取樣運算,而適當大小仍得透過實證調校決定。長時間訓練也可能導致熵崩潰,也就是策略過早變得過度自信並停止探索;也可能造成長度膨脹,因為較長答案恰好與獎勵呈現相關。這些問題大多有緩解方式,Hugging Face TRL 等框架的實作也提供相關控制參數,但 GRPO 絕非設定好之後便能置之不理的演算法。

← 所有術語
ESC