大模型训练方法、框架与技术栈

摘要:大模型训练并不是选择一个框架就结束了。训练目标、参数更新方式、上层工作流、分布式执行和在线生成分别由不同技术负责。本文从学习视角梳理主流训练方法与框架分层,解释它们如何组合,并给出按任务、开发方式和硬件规模进行选型的思路。

关键词:大模型训练、SFT、DPO、PPO、GRPO、LoRA、QLoRA、TRL、LLaMA-Factory、Axolotl、Unsloth、Open-R1、verl、DeepSpeed、FSDP、Megatron-Core

本文基于 2026 年 8 月可查的官方资料整理。开源框架更新很快,具体参数和支持矩阵请以项目对应版本的官方文档为准。


一、先建立大模型训练的全景图

一个模型从“基础模型”走向“可用助手”,可能经历如下过程:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
海量原始文本、代码、多模态数据

预训练 Pre-training

Base Model:会续写、有通用知识,但不一定会听指令

继续预训练 Continued Pre-training(可选)

吸收金融、法律、医疗、代码等领域分布

监督微调 SFT

学会对话格式、任务步骤、工具调用和标准回答

偏好优化 DPO 等(可选)

更偏好安全、清晰、有帮助的回答

强化学习 PPO / GRPO 等(可选)

针对可评分目标在线探索和优化

评测、量化、部署、监控和数据回流

这不是每个项目都必须完整执行的流水线。实际情况可能是:

  • 企业客服模型:基座模型 → SFT → DPO;
  • 数学推理模型:基座模型 → 推理轨迹 SFT → GRPO;
  • 行业知识模型:基座模型 → 继续预训练 → SFT;
  • 小型本地模型:基座模型 → QLoRA SFT → 量化部署;
  • 从零训练基础模型:数据工程 → 大规模预训练 → 多阶段后训练。

因此,第一原则是:先确定训练阶段,再选择框架。


大模型训练基础(3)-常用后训练方法

大模型后训练路线

1
2
3
4
5
6
7
8
9
10
11
大模型后训练(Post-training)

├── 监督学习
│ └── SFT:学习“标准答案应该怎么写”

├── 偏好学习
│ └── DPO:学习“回答 A 比回答 B 更好”

└── 强化学习
├── PPO:根据奖励训练,通常需要 Value Model
└── GRPO:根据同题多答案的相对奖励训练,通常不需要 Value Model

LLM_Train_Method_2_illustration

7. DPO:直接偏好优化

方法类型:直接偏好优化。通常使用提前准备好的离线偏好对,不需要在训练过程中运行完整的强化学习 rollout。

7.1 原理

DPO(Direct Preference Optimization)的核心思想是:直接拿“好回答”和“差回答”训练,让模型更倾向好回答,不再先训练一个阅卷老师,再做一轮 PPO。

训练时还会保留一个冻结的 reference model 作为参照,避免模型只顾拉开好坏答案的差距而偏离原模型太远。可以理解为:

1
2
3
4
对同一个问题:
提高 chosen 的相对倾向
降低 rejected 的相对倾向
同时参考原模型,防止整体改变过猛

大模型训练基础概念(2)

  1. 预训练与继续预训练

4.1 预训练(Pre-training)

定义:在海量通用或混合语料上使用自监督目标训练模型,主要获取语言、知识和基础能力。

通俗解释:给模型阅读海量网页、书籍、代码等内容,让它反复做“猜下一个 token”的练习。原始数据不需要人工逐条写答案,文本的下一个 token 本身就是答案。

样例数据:预训练数据通常只是连续文本,而不是问答对。

1
2
{"text": "水在标准大气压下的沸点约为100摄氏度。温度继续升高时,液态水会逐渐转化为水蒸气。"}
{"text": "def fibonacci(n):\n if n < 2:\n return n\n return fibonacci(n-1) + fibonacci(n-2)"}

模型会自动从每段文本中产生大量“根据前文预测下一个 token”的训练题。

适用场景

  • 从零构建基础模型;
  • 有足够数据、算力和工程团队;
  • 现有模型在语言、授权、架构或核心能力上不满足需求。

优势:能力上限和数据分布可控,可形成自主基座。

劣势:数据、算力、稳定性、分布式系统和评测成本极高;失败代价大。

4.2 继续预训练(Continued Pre-training / Domain-Adaptive Pre-training)

定义:从已有基座继续使用语言建模目标训练,而不是使用问答标签。

通俗解释:基座模型已经读完“通识课程”,现在让它集中阅读某个专业的原始材料。例如继续阅读证券研报、法律条文或公司代码库,使它熟悉该领域的术语、表达和知识分布。

金融领域样例数据

1
2
{"text": "资产负债率是企业负债总额与资产总额的比率,常用于衡量企业的长期偿债能力……"}
{"text": "本报告期内,公司经营活动产生的现金流量净额同比增长18.6%,主要原因是应收账款周转改善……"}

大模型训练基础概念理解(1)

一个典型大语言模型(LLM)的生命周期可以概括为:

1
2
3
4
5
6
7
8
9
10
11
12
13
原始数据
↓ 清洗、去重、过滤、配比、分词
预训练(Next-Token Prediction)
↓ 获得 Base Model:会续写、有知识,但未必会听指令
继续预训练(可选,领域知识/新语言/长上下文)

监督微调 SFT
↓ 获得 Instruction Model:学会指令格式和示范行为
偏好或强化优化(DPO / PPO-RLHF / GRPO 等)
↓ 提升有用性、安全性、风格、推理或可验证任务能力
评测、压缩、量化、部署

在线推理、监控、数据回流、迭代训练

预训练主要解决“能力和知识从哪里来”,SFT 解决“如何按指令表现”,偏好优化解决“多个看似合理的答案中更偏好哪个”,推理系统解决“如何以可接受的成本和延迟把能力交付出来”。

查看更多


Your browser is out-of-date!

Update your browser to view this website correctly. Update my browser now

×