跳到主要内容
Zubnet AI学习Wiki › GRPO
训练

GRPO

别名:Group Relative Policy Optimization、群体相对策略优化
一种用于微调语言模型的强化学习算法,由 DeepSeek 于 2024 年提出,再因 DeepSeek-R1 而走红。它不训练单独的价值模型来评判输出,而是为每条提示词采样一组候选答案,将每一个与整组平均奖励比较。这让强化学习运行起来更便宜、更简单,也成了在具有可验证奖励的任务上后训练推理模型的标准选择。

为什么重要

GRPO 砍掉 critic 模型,降低了 RL 微调成本;经典流水线原本必须训练并把这个大型模型留在内存里,于是没有前沿实验室基础设施的团队,也终于够得着推理式训练。它既是 DeepSeek-R1 背后的算法,此后也出现在大多数开放推理模型中,因此如今几乎每一套认真的后训练栈都能见到它。你使用的模型只要接受过数学、代码或逻辑解题训练,GRPO 很可能就参与其中。

深度解析

GRPO——Group Relative Policy Optimization——最早出现在 DeepSeek 2024 年的 DeepSeekMath 论文中,一年后又作为 DeepSeek-R1 背后的训练算法声名大噪;这款开放模型证明,只靠强化学习就可以引出冗长、会自我检查的思维链。从核心看,它是对 PPO 的务实简化,而 PPO 正是经典 RLHF 流水线的驱动算法。PPO 会训练第二个大模型,也就是 critic,估计只生成了一部分的答案究竟有多好;GRPO 干脆把 critic 扔掉。面对每条提示词,当前策略会采样一组候选输出,每份输出得到一个奖励,其优势就是自己的奖励比整组平均值高出或低下多少。得到的 RL 循环运行成本更低、更容易调,也天然适合训练推理模型所用的可验证奖励。

群体如何取代 critic

PPO 中,critic 的任务是预测一份未完成答案的预期奖励,让算法判断最终结果比预期更好还是更差。GRPO 不用神经网络,而是用统计量拿到同一种基线信号。给定一条提示词,策略会生成 G 个输出组成的群体——实践中从 8 个到 64 个不等——再为每一份输出打分;可以用规则检查器,例如数学答案是否匹配、代码是否通过测试,也可以用学出来的奖励模型。每份输出的优势,就是它的奖励减去群体平均值,再除以群体标准差。高于平均的输出会被提高概率,低于平均的则被压低,而 PPO 式裁剪目标加上朝冻结参考模型收拢的 KL 惩罚,会把每次更新限制在小范围。由于基线按提示词计算,所有样本得分相同的提示词几乎不贡献梯度——实践中,这一点格外重要。

为什么更便宜、更稳定

节省很具体。经典 PPO 流水线训练时要同时在内存里放四个模型——策略、冻结参考策略、奖励模型,以及通常与策略一样大的 critic——critic 还得与其他部分一起训练,而这个过程出了名地难伺候。GRPO 移除四者中最麻烦的一个,释放VRAM,可以装更大的 batch 或模型,也顺手消灭一整类价值学习 bug。群体归一化还会自动处理奖励尺度:如果某条提示词的奖励都挤在一起,其优势就会被压向零,于是更新会聚焦在模型输出质量确实有差别的提示词上。代价是,计算预算从训练 critic 转移到推理:每一步都要针对数千条提示词,各生成 16 或 32 份样本,因此瓶颈通常是采样器,不是优化器。

它是优化器,不是推理配方

一个常见误解是,GRPO 天生就与推理或可验证奖励绑定——仿佛算法自己造出了 DeepSeek-R1 中的行为。并没有。GRPO 与奖励类型无关:无论给它什么信号,它都会欣然最大化,包括由学习式奖励模型打出的开放式品质,例如有用性或风格。推理突破来自整个组合——GRPO 加基于规则的可验证奖励,加一个强基础模型,再加足够长的训练,让自我验证等行为有机会涌现——如今这套配方被称为 RLVR。反过来,可验证奖励配普通 PPO 也完全有效,GRPO 出现以前,已经有几家实验室这样训练推理模型。实践中必须把两种想法分开:如果团队只采用 GRPO,却没有仔细设计奖励、也不给足计算,就期待推理凭算法自行涌现,通常会失望。

它会在哪里失灵

GRPO 的优雅也带来值得了解的失败模式。讨论最多的是全有或全无的群体:一条提示词的所有样本如果奖励相同——全对或全错——每个优势都会变成零,提示词也就毫无贡献,因此训练信号非常依赖难度落在模型有时能成功的区间。困难任务上的奖励稀疏会让情况更糟,所以实用流水线会混入简单问题,或给予部分分数。群体太小,基线就嘈杂;群体太大,又会耗费更多采样计算,究竟多大合适仍要靠经验调。长时间训练还可能出现熵坍缩,也就是策略过早变得自信,不再探索;或者长度膨胀,因为答案越长恰好越容易关联到高奖励。这些问题大多都有缓解办法,Hugging Face TRL 等框架中的实现也暴露了相应旋钮,但 GRPO 绝不是打开就能忘掉的算法。

← 所有术语
ESC