跳到主要内容
Zubnet AI学习Wiki › Post-Training
训练

Post-Training

别名:Post-training
模型在预训练之后经历的一系列训练阶段,把原始的下一个 token 预测器变成可用的助手。它通常结合示范数据上的监督微调、来自人类或 AI 反馈的偏好调校、可验证任务上的强化学习,以及安全训练。模型的行为、语气和边界,实际上都是在后训练阶段定下来的。

为什么重要

两个在几乎相同数据上预训练的模型,到了生产环境里手感可能完全不同,差别就在后训练的选择上:一个干净利落地遵循指令、拒绝有害请求,另一个则啰里啰嗦或过度拒绝。推理模型时代让后训练成了前沿实验室之间拉开差距的主战场,同时它也是小团队不必付预训练的钱就能真正重塑模型的那一层。

深度解析

刚结束预训练的基础模型是一件强大但难用的半成品:它只会续写文本而不是回答问题,没有自己是助手的概念,模仿训练数据里最差的内容和模仿最好的内容一样起劲。后训练通过一连串阶段把这件半成品变成产品,每个阶段都有自己的数据、目标和失败模式。经典配方—由 OpenAI 的 InstructGPT 在 2022 年带火,如今每个主要实验室都在以某种形式使用—从示范数据上的监督微调开始,接着做偏好优化,并越来越多地加入大剂量的强化学习。整条流水线的算力开销只是预训练的一小部分,却几乎决定了用户实际体验到的一切:风格、格式、拒绝行为,以及模型如何推理。

监督微调先行

第一个阶段是指令微调:在输入-输出对上做监督微调,向模型展示一个好的助手回答长什么样。按预训练的标准,这些数据集小得可怜—几千到几百万条精选样本,而不是数万亿 token—质量压倒数量,因为示范里有什么习惯,模型就吸收什么习惯。如今这类数据大部分是合成数据,由更强的模型生成和过滤,而不是靠付费标注员。SFT 还会装入聊天模板,即标记系统、用户和助手轮次的特殊 token,这就是为什么同一个模型的基础版和指令版表现天差地别。这个阶段做过头,模型会开始丢失预训练得来的能力,一种温和的灾难性遗忘,表现为你根本没碰过的技能出现回退。

用 RLHF 和 DPO 做偏好调校

示范不可能教会一切,所以下一个阶段优化的是偏好:人类评分员对模型成对的回答排序,这些排序训练出一个奖励模型,然后调校策略让它在奖励模型面前拿高分。最初的配方跑强化学习,通常是带 KL 惩罚的 PPO,防止策略漂移太远,正是这条 RLHF 流水线把 GPT-3 级别的基础模型变成了 ChatGPT。DPO(2023 年)把整套循环折叠成一个直接作用在偏好对上的监督式目标,不需要奖励模型,也不需要 RL 那套机器,让任何能跑微调的人都够得着偏好调校。但两种方法都不是免费的:随着策略学会利用奖励模型的盲区,奖励模型会被过度优化;偏好调校还是谄媚行为的已知推手,因为评分员天然偏爱顺从、自信、讨人喜欢的回答。

推理时代改变了这笔账

近期最大的转变是可验证奖励强化学习:奖励不再来自人类判断,而是来自自动检查器—数学答案对不对得上标准答案,代码跑不跑得过单元测试。因为不需要标注员,这种 RLVR 式训练的规模可以远超偏好数据,而像 GRPO 这样由 DeepSeek 在 2024 年提出的算法,干脆砍掉价值模型,进一步压低了成本。这正是推理模型一代背后的配方—OpenAI 的 o1、DeepSeek-R1 及其后继者—模型通过 RL 而非模仿,学会长思维链、回溯和自我修正。一条流行的捷径是蒸馏:用前沿模型的长推理轨迹训练小模型,完全不跑 RL 就能捕获大部分行为,DeepSeek 对 R1 的小型 Qwen 和 Llama 变体就是这么做的。无论走哪条路,后训练算力—曾经的事后添头—如今已是与测试时计算并列的一流扩展轴。

安全也在这里

用户体验到的安全几乎全是后训练:拒绝行为、对危险请求的处理、越狱压力下的稳健性。实验室把安全样本混进 SFT,给奖励模型加入无害信号,发布前用红队测试猛锤检查点;Anthropic 的 Constitutional AI 则用对照成文原则检查的 AI 反馈,替换掉一部分人类无害标注。难的是拿捏分寸—安全训练太少,模型就危险;太多,它连安全研究、医学问题和暗黑虚构都拒绝。这些行为还浮在表层:几百步微调就能把它们从开放权重模型上剥掉,这是每一次开放发布都绕不开的现实担忧。

它塑造的是行为,不是知识

一个挥之不去的误解是:后训练能教给模型新事实。大多数情况下并不能:包括 2023 年 LIMA 这类工作背后的“表层对齐假说”在内的证据表明,几乎所有知识都来自预训练,后训练主要做的是把已有的东西呈现出来、格式化、加以约束。这有实际后果。如果模型缺一项能力,更大的 SFT 数据集很少能补上—知识必须来自基础模型,否则 RL 阶段就需要一个能真正练习该行为的可验证任务。这也解释了为什么指望后训练来填补事实漏洞是个冒险的计划,以及为什么检索或换个基础模型通常才是诚实的答案。

← 所有术语
ESC