大模型基础概念理解

一个典型大语言模型(LLM)的生命周期可以概括为:

1
2
3
4
5
6
7
8
9
10
11
12
13
原始数据
↓ 清洗、去重、过滤、配比、分词
预训练(Next-Token Prediction)
↓ 获得 Base Model:会续写、有知识,但未必会听指令
继续预训练(可选,领域知识/新语言/长上下文)

监督微调 SFT
↓ 获得 Instruction Model:学会指令格式和示范行为
偏好对齐(DPO / PPO-RLHF / GRPO 等)
↓ 提升有用性、安全性、风格、推理或可验证任务能力
评测、压缩、量化、部署

在线推理、监控、数据回流、迭代训练

预训练主要解决“能力和知识从哪里来”,SFT 解决“如何按指令表现”,偏好优化解决“多个看似合理的答案中更偏好哪个”,推理系统解决“如何以可接受的成本和延迟把能力交付出来”。

查看更多


Your browser is out-of-date!

Update your browser to view this website correctly. Update my browser now

×