预训练与继续预训练
4.1 预训练(Pre-training) 定义 :在海量通用或混合语料上使用自监督目标训练模型,主要获取语言、知识和基础能力。
通俗解释 :给模型阅读海量网页、书籍、代码等内容,让它反复做“猜下一个 token”的练习。原始数据不需要人工逐条写答案,文本的下一个 token 本身就是答案。
样例数据 :预训练数据通常只是连续文本,而不是问答对。
1 2 {"text" : "水在标准大气压下的沸点约为100摄氏度。温度继续升高时,液态水会逐渐转化为水蒸气。" } {"text" : "def fibonacci(n):\n if n < 2:\n return n\n return fibonacci(n-1) + fibonacci(n-2)" }
模型会自动从每段文本中产生大量“根据前文预测下一个 token”的训练题。
适用场景 :
从零构建基础模型;
有足够数据、算力和工程团队;
现有模型在语言、授权、架构或核心能力上不满足需求。
优势 :能力上限和数据分布可控,可形成自主基座。
劣势 :数据、算力、稳定性、分布式系统和评测成本极高;失败代价大。
4.2 继续预训练(Continued Pre-training / Domain-Adaptive Pre-training) 定义 :从已有基座继续使用语言建模目标训练,而不是使用问答标签。
通俗解释 :基座模型已经读完“通识课程”,现在让它集中阅读某个专业的原始材料。例如继续阅读证券研报、法律条文或公司代码库,使它熟悉该领域的术语、表达和知识分布。
金融领域样例数据 :
1 2 {"text" : "资产负债率是企业负债总额与资产总额的比率,常用于衡量企业的长期偿债能力……" } {"text" : "本报告期内,公司经营活动产生的现金流量净额同比增长18.6%,主要原因是应收账款周转改善……" }