大模型训练基础概念(2)

大模型训练基础概念(2)

  1. 预训练与继续预训练

4.1 预训练(Pre-training)

定义:在海量通用或混合语料上使用自监督目标训练模型,主要获取语言、知识和基础能力。

通俗解释:给模型阅读海量网页、书籍、代码等内容,让它反复做“猜下一个 token”的练习。原始数据不需要人工逐条写答案,文本的下一个 token 本身就是答案。

样例数据:预训练数据通常只是连续文本,而不是问答对。

1
2
{"text": "水在标准大气压下的沸点约为100摄氏度。温度继续升高时,液态水会逐渐转化为水蒸气。"}
{"text": "def fibonacci(n):\n if n < 2:\n return n\n return fibonacci(n-1) + fibonacci(n-2)"}

模型会自动从每段文本中产生大量“根据前文预测下一个 token”的训练题。

适用场景

  • 从零构建基础模型;
  • 有足够数据、算力和工程团队;
  • 现有模型在语言、授权、架构或核心能力上不满足需求。

优势:能力上限和数据分布可控,可形成自主基座。

劣势:数据、算力、稳定性、分布式系统和评测成本极高;失败代价大。

4.2 继续预训练(Continued Pre-training / Domain-Adaptive Pre-training)

定义:从已有基座继续使用语言建模目标训练,而不是使用问答标签。

通俗解释:基座模型已经读完“通识课程”,现在让它集中阅读某个专业的原始材料。例如继续阅读证券研报、法律条文或公司代码库,使它熟悉该领域的术语、表达和知识分布。

金融领域样例数据

1
2
{"text": "资产负债率是企业负债总额与资产总额的比率,常用于衡量企业的长期偿债能力……"}
{"text": "本报告期内,公司经营活动产生的现金流量净额同比增长18.6%,主要原因是应收账款周转改善……"}

这里不需要把材料改造成“什么是资产负债率?”的问答,模型仍然通过预测下一个 token 学习。

适用场景:金融、医疗、法律、代码、新语言等领域知识或表达分布迁移;也可用于扩展上下文长度,但通常还需位置编码和训练策略配合。

优势:比 SFT 更适合注入大量无标注领域语料和术语分布。

劣势:容易灾难性遗忘;语料质量不佳会损害模型;“见过知识”不保证“按要求回答”。

5. SFT:监督微调

方法类型:监督学习。SFT 与 DPO、PPO、GRPO 同属于后训练阶段的重要方法

定义:使用“输入—目标输出”示范数据,通过交叉熵训练模型模仿目标答案。聊天场景的数据常由 system、user、assistant 消息组成。

通俗解释:老师不只给教材,还亲自示范“用户这样问时,一个好助手应该这样回答”。模型模仿 assistant 部分的每一个 token。

普通问答样例

1
2
3
4
5
6
7
{
"messages": [
{"role": "system", "content": "你是一名耐心的银行客服。"},
{"role": "user", "content": "银行卡丢失后应该怎么办?"},
{"role": "assistant", "content": "请立即通过银行 App、客服电话或柜台办理临时挂失,并检查近期交易记录。如发现异常交易,请同时联系银行申诉。"}
]
}

结构化输出样例

1
2
3
4
5
6
{
"messages": [
{"role": "user", "content": "从文本中提取姓名和城市:李雷目前居住在上海。"},
{"role": "assistant", "content": "{\"name\": \"李雷\", \"city\": \"上海\"}"}
]
}

工具调用样例

1
2
3
4
5
6
{
"messages": [
{"role": "user", "content": "查询北京明天的天气。"},
{"role": "assistant", "tool_calls": [{"name": "get_weather", "arguments": {"city": "北京", "date": "明天"}}]}
]
}

模型从这些数据学到的是回答方式、格式和行为。如果示范中总是啰嗦、事实错误或格式不统一,模型也会模仿这些问题。

典型场景

  • 让 Base Model 学会指令遵循和对话格式;
  • 领域问答、结构化输出、工具调用;
  • 学习专家示范、特定语气或安全规范;
  • 作为 DPO、PPO、GRPO 前的冷启动模型。

优势:简单稳定、训练效率高;数据和目标清晰;容易离线训练和复现。

劣势

  • 只能模仿数据中出现的目标,难表达“答案 A 比 B 好多少”;
  • 对标注质量极其敏感;
  • 对开放问题,单个标准答案会惩罚其他同样合理的回答;
  • 过度训练可能遗忘基座能力或造成风格僵化。

面试要点:SFT 不是“把知识写进模型”的万能方法。若只有大量无标注领域文档,继续预训练或 RAG 往往比强行转成少量 QA 更合理;若需求是改变行为格式,SFT 更直接。

6. 偏好学习与强化学习基础

先明确它们的分类关系:

1
2
3
4
5
6
7
8
大模型后训练
├── 监督学习
│ └── SFT:学习标准示范
├── 偏好优化
│ └── DPO:学习 chosen 优于 rejected
└── 强化学习
├── PPO:使用奖励和 Value Model 更新策略
└── GRPO:使用同题多回答的相对奖励更新策略

这四种方法不是必须依次执行。常见流程是先做 SFT,再根据数据和目标选择 DPO、PPO 或 GRPO。

6.1 偏好数据

最常见格式是:

1
2
3
4
5
{
"prompt": "我服用了双倍剂量的药,现在该怎么办?",
"chosen": "请立即查看药品说明书并联系医生、药师或当地急救/中毒咨询机构。若出现呼吸困难、意识异常等症状,请马上呼叫急救。不要自行催吐。",
"rejected": "多喝水休息一下就好了,不用担心。"
}

偏好可以来自人工、规则、奖励模型、AI 评审或可验证答案。数据要避免仅凭长度、格式等浅层特征就能区分 chosen/rejected,否则模型会学到偏差。

这条数据没有声称 chosen 是唯一正确写法,只告诉模型:在这两个回答中,chosen 更安全、更值得偏好。


6.2 RLHF:从人类反馈中进行强化学习

6.2.1 定义

RLHF(Reinforcement Learning from Human Feedback)是一类利用人类反馈构造奖励信号,再优化模型策略的方法。它不是某一个具体算法;PPO 可以是 RLHF 的策略优化算法之一,DPO 则是偏好对齐的另一条直接优化路线。

经典 InstructGPT 式流程为:

  1. SFT:用高质量示范训练初始策略;
  2. Reward Model(RM):对同一 prompt 的多个回答进行人工排序,训练奖励模型;
  3. RL 优化:用 PPO 等算法最大化奖励,同时用 KL 约束防止策略偏离参考模型过远。

通俗解释:先训练一个“自动阅卷老师”(Reward Model)。它看到同一个问题的两个回答后,要尽量给人类更喜欢的回答更高分。随后让语言模型不断生成回答,并根据这个分数调整。

训练奖励模型的样例数据

1
2
3
4
5
6
7
{
"prompt": "请解释什么是缓存。",
"responses": [
{"text": "缓存是把常用数据暂时放在访问更快的位置,以减少重复计算或慢速读取。", "rank": 1},
{"text": "缓存就是一种数据库。", "rank": 2}
]
}

奖励模型学习的是排序,不一定要求人工给出精确的“8.7 分”。

6.2.2 LLM 强化学习中的要素

RL 概念 LLM 中的对应
Agent / Policy 待训练语言模型 (\pi_\theta)
State prompt 与已经生成的 token
Action 下一个 token
Trajectory 一整段生成回复
Reward RM 分数、规则分或答案验证分
Reference Policy 通常是冻结的 SFT 模型,用于 KL 约束

6.2.3 优势与局限

优势

  • 可直接优化不可微但可评分的序列级目标;
  • 能从比较反馈而非唯一标准答案中学习;
  • 适合在线采样当前模型的答案再训练。

局限

  • 系统复杂:策略、参考模型、奖励模型、价值模型可能同时存在;
  • 在线 rollout 昂贵,吞吐容易成为瓶颈;
  • 训练不稳定,超参数多;
  • 奖励模型只是人类偏好的代理,可能被模型钻空子,即 reward hacking;
  • 标注偏差和群体价值冲突不会因使用 RL 自动消失。

6.3 RLAIF

RLAIF(Reinforcement Learning from AI Feedback)使用 AI 反馈替代或补充人工反馈。它能扩展数据规模、降低成本,但会继承评审模型的偏差,并可能形成自我强化。实践中通常结合人工抽检、规则、可验证奖励和多评审器。

未完待续

PS imagegen VS 豆包 ,哪个好看些:

1
基于文档 生成图片,要求 960 × 540 像素,笔绘风格(不要机械风格),卡通字体,图片内容吸引人即可,信息密度适量即可,不需要体现所有内容

chatgpt

LLM_Train_Basic_2_illustration

Doubao:

LLM_Training_method_2


 

Comments

Your browser is out-of-date!

Update your browser to view this website correctly. Update my browser now

×