大模型后训练路线
1 | 大模型后训练(Post-training) |

7. DPO:直接偏好优化
方法类型:直接偏好优化。通常使用提前准备好的离线偏好对,不需要在训练过程中运行完整的强化学习 rollout。
7.1 原理
DPO(Direct Preference Optimization)的核心思想是:直接拿“好回答”和“差回答”训练,让模型更倾向好回答,不再先训练一个阅卷老师,再做一轮 PPO。
训练时还会保留一个冻结的 reference model 作为参照,避免模型只顾拉开好坏答案的差距而偏离原模型太远。可以理解为:
1 | 对同一个问题: |
DPO 样例数据:
1 | { |
这类数据可以提前离线准备。DPO 训练期间通常不需要像 PPO 那样不断生成新回答。
7.2 场景、优势、劣势
适用场景:已有高质量离线 chosen/rejected 数据;希望以较低工程复杂度完成对齐;训练资源有限。
优势:无需显式 RM、critic 和在线 rollout;训练形式接近分类/语言模型微调;稳定、实现简单、显存与计算成本通常低于 PPO-RLHF。
劣势:
- 依赖固定离线偏好数据,模型难以主动探索数据未覆盖的输出;
- 数据由旧策略产生时,可能与当前策略分布失配;
- 对偏好噪声、长度偏差和 reference model 敏感;
- 不适合只有单个标量 reward、却没有成对偏好样本的直接场景;
- 训练 loss 下降不代表开放式人评一定提高。
7.3 DPO 不是 RLHF 的简单同义词
广义上,DPO 可以使用人类偏好完成 alignment;但经典术语中,RLHF 常特指“人类偏好 → 奖励模型 → 强化学习”。面试时最好明确采用广义还是狭义定义,避免概念争执。
8. PPO:经典 on-policy 强化学习路线
方法类型:强化学习中的策略优化算法。经典 LLM RLHF 流程通常还需要 Reward Model、Reference Model 和 Value Model。
8.1 原理
PPO(Proximal Policy Optimization)的核心思想是:奖励高的回答以后多生成,奖励低的回答以后少生成,但每次不要改得太猛。
可以把它想成教练训练运动员:
- 当前模型针对一批问题现场生成回答,这叫 rollout;
- 奖励模型或规则给每条回答打分;
- value model 估计“这类问题通常能拿多少分”;
- 实际得分高于预期,说明这次做法值得加强;低于预期则应削弱;
- PPO 的 clip 机制限制单次调整幅度;
- KL 约束像一根安全绳,避免模型为了高分突然变得不像原来的正常语言模型。
一次 rollout 的示意数据:
1 | { |
这些数据通常由训练中的当前模型在线生成,不是一次性准备好后永远不变。
8.2 场景、优势、劣势
适用场景:有可在线计算的奖励;需要直接优化模型自身生成分布;奖励不必可微;团队有成熟 RL 基础设施。
优势:通用、能在线探索;可直接使用标量奖励;相比无约束 policy gradient 更稳定。
劣势:rollout 成本高,近似 on-policy 导致旧数据复用受限;通常需要 value/critic;工程复杂且对奖励尺度、KL 系数、采样策略敏感。
9. GRPO:组相对策略优化
方法类型:强化学习中的策略优化算法。它使用同一道题多个回答的组内相对表现估计学习信号,通常省去 Value Model。
9.1 原理
GRPO(Group Relative Policy Optimization)的核心思想是:让模型对同一道题生成一组答案,组内互相比较,好的加强、差的削弱。
例如同一道数学题生成 4 个回答:
1 | { |
这一组的平均分是 0.5。得 1 分的回答高于组内平均水平,训练时会加强;得 0 分的回答低于平均水平,会削弱。实际算法还会做归一化、裁剪并加入 KL 约束。
GRPO 的关键价值是用同一道题多个回答的组内平均表现充当参照,通常不必另训一个 value model,因此比 PPO 少维护一个大模型。
注意:不同框架和后续论文对 token-level loss、KL 估计、长度归一化、clip 范围、旧策略更新频率等实现并不完全相同。面试中应先讲核心思想,再说明实现版本。
9.2 场景、优势、劣势
适用场景:数学、代码、逻辑题、结构化任务等可用规则或 verifier 给出可靠奖励的场景;能够为每个 prompt 并行采样多个候选回答。
优势:
- 不需要单独的 value/critic 模型,显存更省;
- 同题组内比较能缓解不同问题奖励难度尺度不一致;
- 在线采样,能针对当前策略持续探索;
- 与可验证奖励结合时,扩展性较好。
劣势:
- 每个 prompt 要生成多个回答,rollout 成本仍高;
- 若一组答案 reward 全相同,组内 advantage 几乎没有学习信号;
- 奖励稀疏、验证器有漏洞时会导致无效探索或 reward hacking;
- 组大小、采样温度、长度偏差和奖励归一化会明显影响稳定性;
- 对主观开放式任务,可靠 reward 比算法本身更难获得。
10. SFT、DPO、PPO、GRPO 横向对比
| 维度 | SFT | DPO | PPO-RLHF | GRPO |
|---|---|---|---|---|
| 学习信号 | 标准答案 token | chosen/rejected 对 | 标量 reward + advantage | 同题多回答的相对 reward |
| 是否在线采样 | 否 | 通常否 | 是 | 是 |
| 是否需要 Reward Model | 否 | 否 | 经典 RLHF 通常需要 | 可用规则、RM 或 verifier |
| 是否需要 Value Model | 否 | 否 | 通常需要 | 通常不需要 |
| 工程复杂度 | 低 | 中低 | 高 | 中高 |
| 训练稳定性 | 高 | 较高 | 较敏感 | 较敏感 |
| 探索当前策略输出 | 弱 | 弱 | 强 | 强 |
| 典型用途 | 指令与格式、知识/任务示范 | 离线偏好对齐 | 通用在线偏好优化 | 可验证推理强化 |
| 主要瓶颈 | 高质量示范数据 | 偏好数据覆盖和质量 | rollout、RM/critic、稳定性 | 多样本 rollout、稀疏奖励 |
把四种方法放在同一道题上看,会更直观:
| 方法 | 喂给模型的数据 | 模型收到的信号 |
|---|---|---|
| SFT | 问题 + 一条标准回答“96 元” | 照着这条答案学习 |
| DPO | 问题 + 好回答“96 元” + 差回答“100 元” | 好回答应比差回答更受偏好 |
| PPO | 当前模型生成一条回答,奖励系统给 0.8 分 | 这次回答比预期好还是差 |
| GRPO | 当前模型对同题生成多条回答,分别得 1/0/1/0 分 | 在同组中,哪些回答相对更好 |
10.1 选型口诀
- 有标准示范,目标是学会怎么答:优先 SFT。
- 有高质量偏好对,资源有限,想稳定对齐:优先 DPO。
- 有可靠标量奖励,需要在线探索,基础设施成熟:考虑 PPO。
- 每题可采多条轨迹且答案可验证,尤其数学/代码推理:考虑 GRPO。
- 只是需要新鲜事实或私有知识可追溯:先评估 RAG,不要默认训练。
- 大量无标注领域文本,需要改变底层领域分布:考虑继续预训练。
实际项目常采用组合:继续预训练 → SFT 冷启动 → DPO 或在线 RL → 蒸馏/量化部署,而不是四选一。
