- 预训练与继续预训练
4.1 预训练(Pre-training)
定义:在海量通用或混合语料上使用自监督目标训练模型,主要获取语言、知识和基础能力。
通俗解释:给模型阅读海量网页、书籍、代码等内容,让它反复做“猜下一个 token”的练习。原始数据不需要人工逐条写答案,文本的下一个 token 本身就是答案。
样例数据:预训练数据通常只是连续文本,而不是问答对。
1 | {"text": "水在标准大气压下的沸点约为100摄氏度。温度继续升高时,液态水会逐渐转化为水蒸气。"} |
模型会自动从每段文本中产生大量“根据前文预测下一个 token”的训练题。
适用场景:
- 从零构建基础模型;
- 有足够数据、算力和工程团队;
- 现有模型在语言、授权、架构或核心能力上不满足需求。
优势:能力上限和数据分布可控,可形成自主基座。
劣势:数据、算力、稳定性、分布式系统和评测成本极高;失败代价大。
4.2 继续预训练(Continued Pre-training / Domain-Adaptive Pre-training)
定义:从已有基座继续使用语言建模目标训练,而不是使用问答标签。
通俗解释:基座模型已经读完“通识课程”,现在让它集中阅读某个专业的原始材料。例如继续阅读证券研报、法律条文或公司代码库,使它熟悉该领域的术语、表达和知识分布。
金融领域样例数据:
1 | {"text": "资产负债率是企业负债总额与资产总额的比率,常用于衡量企业的长期偿债能力……"} |
这里不需要把材料改造成“什么是资产负债率?”的问答,模型仍然通过预测下一个 token 学习。
适用场景:金融、医疗、法律、代码、新语言等领域知识或表达分布迁移;也可用于扩展上下文长度,但通常还需位置编码和训练策略配合。
优势:比 SFT 更适合注入大量无标注领域语料和术语分布。
劣势:容易灾难性遗忘;语料质量不佳会损害模型;“见过知识”不保证“按要求回答”。
5. SFT:监督微调
方法类型:监督学习。SFT 与 DPO、PPO、GRPO 同属于后训练阶段的重要方法
定义:使用“输入—目标输出”示范数据,通过交叉熵训练模型模仿目标答案。聊天场景的数据常由 system、user、assistant 消息组成。
通俗解释:老师不只给教材,还亲自示范“用户这样问时,一个好助手应该这样回答”。模型模仿 assistant 部分的每一个 token。
普通问答样例:
1 | { |
结构化输出样例:
1 | { |
工具调用样例:
1 | { |
模型从这些数据学到的是回答方式、格式和行为。如果示范中总是啰嗦、事实错误或格式不统一,模型也会模仿这些问题。
典型场景:
- 让 Base Model 学会指令遵循和对话格式;
- 领域问答、结构化输出、工具调用;
- 学习专家示范、特定语气或安全规范;
- 作为 DPO、PPO、GRPO 前的冷启动模型。
优势:简单稳定、训练效率高;数据和目标清晰;容易离线训练和复现。
劣势:
- 只能模仿数据中出现的目标,难表达“答案 A 比 B 好多少”;
- 对标注质量极其敏感;
- 对开放问题,单个标准答案会惩罚其他同样合理的回答;
- 过度训练可能遗忘基座能力或造成风格僵化。
面试要点:SFT 不是“把知识写进模型”的万能方法。若只有大量无标注领域文档,继续预训练或 RAG 往往比强行转成少量 QA 更合理;若需求是改变行为格式,SFT 更直接。
6. 偏好学习与强化学习基础
先明确它们的分类关系:
1 | 大模型后训练 |
这四种方法不是必须依次执行。常见流程是先做 SFT,再根据数据和目标选择 DPO、PPO 或 GRPO。
6.1 偏好数据
最常见格式是:
1 | { |
偏好可以来自人工、规则、奖励模型、AI 评审或可验证答案。数据要避免仅凭长度、格式等浅层特征就能区分 chosen/rejected,否则模型会学到偏差。
这条数据没有声称 chosen 是唯一正确写法,只告诉模型:在这两个回答中,chosen 更安全、更值得偏好。
6.2 RLHF:从人类反馈中进行强化学习
6.2.1 定义
RLHF(Reinforcement Learning from Human Feedback)是一类利用人类反馈构造奖励信号,再优化模型策略的方法。它不是某一个具体算法;PPO 可以是 RLHF 的策略优化算法之一,DPO 则是偏好对齐的另一条直接优化路线。
经典 InstructGPT 式流程为:
- SFT:用高质量示范训练初始策略;
- Reward Model(RM):对同一 prompt 的多个回答进行人工排序,训练奖励模型;
- RL 优化:用 PPO 等算法最大化奖励,同时用 KL 约束防止策略偏离参考模型过远。
通俗解释:先训练一个“自动阅卷老师”(Reward Model)。它看到同一个问题的两个回答后,要尽量给人类更喜欢的回答更高分。随后让语言模型不断生成回答,并根据这个分数调整。
训练奖励模型的样例数据:
1 | { |
奖励模型学习的是排序,不一定要求人工给出精确的“8.7 分”。
6.2.2 LLM 强化学习中的要素
| RL 概念 | LLM 中的对应 |
|---|---|
| Agent / Policy | 待训练语言模型 (\pi_\theta) |
| State | prompt 与已经生成的 token |
| Action | 下一个 token |
| Trajectory | 一整段生成回复 |
| Reward | RM 分数、规则分或答案验证分 |
| Reference Policy | 通常是冻结的 SFT 模型,用于 KL 约束 |
6.2.3 优势与局限
优势:
- 可直接优化不可微但可评分的序列级目标;
- 能从比较反馈而非唯一标准答案中学习;
- 适合在线采样当前模型的答案再训练。
局限:
- 系统复杂:策略、参考模型、奖励模型、价值模型可能同时存在;
- 在线 rollout 昂贵,吞吐容易成为瓶颈;
- 训练不稳定,超参数多;
- 奖励模型只是人类偏好的代理,可能被模型钻空子,即 reward hacking;
- 标注偏差和群体价值冲突不会因使用 RL 自动消失。
6.3 RLAIF
RLAIF(Reinforcement Learning from AI Feedback)使用 AI 反馈替代或补充人工反馈。它能扩展数据规模、降低成本,但会继承评审模型的偏差,并可能形成自我强化。实践中通常结合人工抽检、规则、可验证奖励和多评审器。
未完待续
PS imagegen VS 豆包 ,哪个好看些:
1 | 基于文档 生成图片,要求 960 × 540 像素,笔绘风格(不要机械风格),卡通字体,图片内容吸引人即可,信息密度适量即可,不需要体现所有内容 |
chatgpt

Doubao:
