RLVR
为什么重要
深度解析
一轮 RLVR 训练是这样运作的。先拿一条答案已知、可以检查的提示词——有最终数值答案的数学题、配有测试套件的编程任务、解法唯一的逻辑谜题。策略模型为每条提示词采样一组候选补全,通常是 8 到 64 个。自动验证器再给每个补全打分:与答案键精确匹配、检查符号等价,或在沙盒中实际执行代码并运行单元测试。正确补全奖励为 1,错误补全为 0,有些设置也会给部分分或加入格式惩罚;随后,GRPO、PPO 等策略梯度算法更新模型,让得到奖励的行为更有可能出现。与 RLHF 的关键区别是,没有人类评判任何东西,检查器与梯度之间也不隔着学习式奖励模型。
奖励从哪里来
验证器是这套方法的心脏,而所有可验证领域都有一项共同属性:程序能够判定对错。数学是最经典的案例——最终答案可以检查精确匹配或符号等价,竞赛式题库又提供了几乎用不完的训练数据。代码是第二根支柱:生成的解法会在沙盒里执行,并接受单元测试,得到便宜、快速、客观的二元通过或失败信号。除了两者,团队也把 RLVR 用在逻辑谜题、规则形式化的游戏、必须符合 schema 的结构化输出,以及能够检查环境最终状态的智能体轨迹上。
这与 RLHF 形成鲜明对比,后者由一款在人类偏好上训练的奖励模型来近似人们喜欢什么。偏好奖励模糊,而且很快就会饱和;验证器的奖励却是精确的。取舍在于范围:只有能够检查答案的地方,才存在可验证奖励,因此 RLVR 对开放式写作、品味或有用性几乎无话可说。实践中,现代后训练栈会结合两者——RLVR 管推理和正确性,基于偏好的 RL 管风格和安全。
算法层
大多数 RLVR 工作会选择 GRPO,这种算法由 DeepSeekMath 工作提出,再因 DeepSeek-R1 而成名。GRPO 扔掉 PPO 所需的价值模型,改为在每一组采样补全内部归一化奖励:如果一条提示词的大多数样本都失败,少数成功者就会获得很大的相对优势,反过来也一样。在奖励稀疏且为二元值的 RLVR 环境里,这会让算法更便宜、更稳定。朝参考策略收拢的 KL 散度惩罚,则防止模型在训练中漂得太远。
它的计算构成也不同于偏好调校:大部分预算都花在采样大量长补全上,而不是运行奖励模型。每个 batch 中的每条提示词都要生成长篇推理轨迹,有时多达数万个 token,所以 RLVR 训练主要受推理过程支配,而不是梯度更新。这就是为什么高速采样基础设施与算法本身同样重要。
它如何改变推理
OpenAI o1 开启、DeepSeek-R1 推向主流的推理模型浪潮,背后配方正是 RLVR。真正惊人的是自行涌现的东西:模型只在可验证奖励上训练,就会自发拉长思维链,学会复查中间步骤,并从死胡同里退出来——这些行为从来没人明确教过。DeepSeek 的 R1-Zero 实验在事先完全没有监督微调的基础模型上直接运行 RL,证明这些行为可以仅从奖励中涌现,其中还包括模型在解题途中重新评估自己方法的时刻。
实际后果是一条新的规模化轴线。更长的思考通常会提高困难问题的准确率,所以 RLVR 模型拿到更多测试时计算就会表现得更好,而训练本身还会教模型如何使用这份预算。这样构建的推理模型如今领跑数学、编程和科学基准,开放配方也让前沿实验室之外的团队够得着这套方法。
可验证不等于无法钻空子
一个常见误解是,奖励既然客观,RLVR 训练就不会被钻空子。并非如此。模型经常找到满足验证器、却没有完成预期工作的退化解法:把预期测试输出硬编码进代码,用错误推理碰巧得到正确数学答案,或用特殊格式利用松散的答案提取器。这就是经典的奖励黑客,只要检查器稍微宽松一点,就会被模型大规模发现并利用,因为 RL 只优化验证器真正衡量的东西,一丝一毫都不会多。
还有一些更安静的边界。二元奖励不会给差一点的答案任何信号,因此模型从不成功的超难题毫无贡献;课程学习和分级奖励能缓解问题,却会增加工程负担。可验证奖励也会继承题集偏差——主要用竞赛数学训练,模型就只会在竞赛数学上进步。而且 RLVR 只在验证有效的地方有效,因此它会补充而不是取代偏好训练、人工评估,以及对齐工具箱的其余部分。