大模型训练基础(3)-常用后训练方法

大模型训练基础(3)-常用后训练方法

大模型后训练路线

1
2
3
4
5
6
7
8
9
10
11
大模型后训练(Post-training)

├── 监督学习
│ └── SFT:学习“标准答案应该怎么写”

├── 偏好学习
│ └── DPO:学习“回答 A 比回答 B 更好”

└── 强化学习
├── PPO:根据奖励训练,通常需要 Value Model
└── GRPO:根据同题多答案的相对奖励训练,通常不需要 Value Model

LLM_SFT_DPO_GRPO_PPO

7. DPO:直接偏好优化

方法类型:直接偏好优化。通常使用提前准备好的离线偏好对,不需要在训练过程中运行完整的强化学习 rollout。

7.1 原理

DPO(Direct Preference Optimization)的核心思想是:直接拿“好回答”和“差回答”训练,让模型更倾向好回答,不再先训练一个阅卷老师,再做一轮 PPO。

训练时还会保留一个冻结的 reference model 作为参照,避免模型只顾拉开好坏答案的差距而偏离原模型太远。可以理解为:

1
2
3
4
对同一个问题:
提高 chosen 的相对倾向
降低 rejected 的相对倾向
同时参考原模型,防止整体改变过猛

DPO 样例数据

1
2
3
4
5
{
"prompt": "写一封拒绝候选人的邮件。",
"chosen": "您好,感谢您投入时间参与面试。经过综合评估,我们此次决定推进其他候选人。感谢您对团队的关注,祝您后续求职顺利。",
"rejected": "你没有通过面试,我们选择了别人。"
}

这类数据可以提前离线准备。DPO 训练期间通常不需要像 PPO 那样不断生成新回答。

7.2 场景、优势、劣势

适用场景:已有高质量离线 chosen/rejected 数据;希望以较低工程复杂度完成对齐;训练资源有限。

优势:无需显式 RM、critic 和在线 rollout;训练形式接近分类/语言模型微调;稳定、实现简单、显存与计算成本通常低于 PPO-RLHF。

劣势

  • 依赖固定离线偏好数据,模型难以主动探索数据未覆盖的输出;
  • 数据由旧策略产生时,可能与当前策略分布失配;
  • 对偏好噪声、长度偏差和 reference model 敏感;
  • 不适合只有单个标量 reward、却没有成对偏好样本的直接场景;
  • 训练 loss 下降不代表开放式人评一定提高。

7.3 DPO 不是 RLHF 的简单同义词

广义上,DPO 可以使用人类偏好完成 alignment;但经典术语中,RLHF 常特指“人类偏好 → 奖励模型 → 强化学习”。面试时最好明确采用广义还是狭义定义,避免概念争执。


8. PPO:经典 on-policy 强化学习路线

方法类型:强化学习中的策略优化算法。经典 LLM RLHF 流程通常还需要 Reward Model、Reference Model 和 Value Model。

8.1 原理

PPO(Proximal Policy Optimization)的核心思想是:奖励高的回答以后多生成,奖励低的回答以后少生成,但每次不要改得太猛。

可以把它想成教练训练运动员:

  1. 当前模型针对一批问题现场生成回答,这叫 rollout;
  2. 奖励模型或规则给每条回答打分;
  3. value model 估计“这类问题通常能拿多少分”;
  4. 实际得分高于预期,说明这次做法值得加强;低于预期则应削弱;
  5. PPO 的 clip 机制限制单次调整幅度;
  6. KL 约束像一根安全绳,避免模型为了高分突然变得不像原来的正常语言模型。

一次 rollout 的示意数据

1
2
3
4
5
6
7
{
"prompt": "用一句话解释光合作用。",
"response": "植物利用光能把二氧化碳和水转化为有机物,并释放氧气。",
"reward": 0.91,
"value_prediction": 0.63,
"advantage": "正值:实际表现高于预期,应提高这类回答的概率"
}

这些数据通常由训练中的当前模型在线生成,不是一次性准备好后永远不变。

8.2 场景、优势、劣势

适用场景:有可在线计算的奖励;需要直接优化模型自身生成分布;奖励不必可微;团队有成熟 RL 基础设施。

优势:通用、能在线探索;可直接使用标量奖励;相比无约束 policy gradient 更稳定。

劣势:rollout 成本高,近似 on-policy 导致旧数据复用受限;通常需要 value/critic;工程复杂且对奖励尺度、KL 系数、采样策略敏感。


9. GRPO:组相对策略优化

方法类型:强化学习中的策略优化算法。它使用同一道题多个回答的组内相对表现估计学习信号,通常省去 Value Model。

9.1 原理

GRPO(Group Relative Policy Optimization)的核心思想是:让模型对同一道题生成一组答案,组内互相比较,好的加强、差的削弱。

例如同一道数学题生成 4 个回答:

1
2
3
4
5
6
7
8
9
{
"prompt": "一个商品原价100元,先涨价20%,再打八折,现价多少?",
"candidates": [
{"answer": "96元。100×1.2×0.8=96。", "reward": 1},
{"answer": "100元,涨20%和降20%抵消。", "reward": 0},
{"answer": "96元。", "reward": 1},
{"answer": "80元。", "reward": 0}
]
}

这一组的平均分是 0.5。得 1 分的回答高于组内平均水平,训练时会加强;得 0 分的回答低于平均水平,会削弱。实际算法还会做归一化、裁剪并加入 KL 约束。

GRPO 的关键价值是用同一道题多个回答的组内平均表现充当参照,通常不必另训一个 value model,因此比 PPO 少维护一个大模型。

注意:不同框架和后续论文对 token-level loss、KL 估计、长度归一化、clip 范围、旧策略更新频率等实现并不完全相同。面试中应先讲核心思想,再说明实现版本。

9.2 场景、优势、劣势

适用场景:数学、代码、逻辑题、结构化任务等可用规则或 verifier 给出可靠奖励的场景;能够为每个 prompt 并行采样多个候选回答。

优势

  • 不需要单独的 value/critic 模型,显存更省;
  • 同题组内比较能缓解不同问题奖励难度尺度不一致;
  • 在线采样,能针对当前策略持续探索;
  • 与可验证奖励结合时,扩展性较好。

劣势

  • 每个 prompt 要生成多个回答,rollout 成本仍高;
  • 若一组答案 reward 全相同,组内 advantage 几乎没有学习信号;
  • 奖励稀疏、验证器有漏洞时会导致无效探索或 reward hacking;
  • 组大小、采样温度、长度偏差和奖励归一化会明显影响稳定性;
  • 对主观开放式任务,可靠 reward 比算法本身更难获得。

10. SFT、DPO、PPO、GRPO 横向对比

维度 SFT DPO PPO-RLHF GRPO
学习信号 标准答案 token chosen/rejected 对 标量 reward + advantage 同题多回答的相对 reward
是否在线采样 通常否
是否需要 Reward Model 经典 RLHF 通常需要 可用规则、RM 或 verifier
是否需要 Value Model 通常需要 通常不需要
工程复杂度 中低 中高
训练稳定性 较高 较敏感 较敏感
探索当前策略输出
典型用途 指令与格式、知识/任务示范 离线偏好对齐 通用在线偏好优化 可验证推理强化
主要瓶颈 高质量示范数据 偏好数据覆盖和质量 rollout、RM/critic、稳定性 多样本 rollout、稀疏奖励

把四种方法放在同一道题上看,会更直观:

方法 喂给模型的数据 模型收到的信号
SFT 问题 + 一条标准回答“96 元” 照着这条答案学习
DPO 问题 + 好回答“96 元” + 差回答“100 元” 好回答应比差回答更受偏好
PPO 当前模型生成一条回答,奖励系统给 0.8 分 这次回答比预期好还是差
GRPO 当前模型对同题生成多条回答,分别得 1/0/1/0 分 在同组中,哪些回答相对更好

10.1 选型口诀

  • 有标准示范,目标是学会怎么答:优先 SFT。
  • 有高质量偏好对,资源有限,想稳定对齐:优先 DPO。
  • 有可靠标量奖励,需要在线探索,基础设施成熟:考虑 PPO。
  • 每题可采多条轨迹且答案可验证,尤其数学/代码推理:考虑 GRPO。
  • 只是需要新鲜事实或私有知识可追溯:先评估 RAG,不要默认训练。
  • 大量无标注领域文本,需要改变底层领域分布:考虑继续预训练。

实际项目常采用组合:继续预训练 → SFT 冷启动 → DPO 或在线 RL → 蒸馏/量化部署,而不是四选一。

LLM_Train_Method_2_illustration


 

Comments

Your browser is out-of-date!

Update your browser to view this website correctly. Update my browser now

×