跳到正文

02 预训练:能力从哪里来

原始课件:pretrain (v10).pptx(61 页)

1. 三阶段训练框架

现代语言模型通常经历三个阶段:

  1. 预训练:使用海量文本做下一个 token 预测,形成知识和基础能力。
  2. 监督微调:使用高质量指令回答样本,教模型按照任务格式作答。
  3. 偏好对齐:使用人类或模型反馈优化有用性、安全性和风格。

基础模型直接对话时可能表现混乱,并不表示它没有能力。对齐数据更像一把“钥匙”,将预训练中已经形成但不容易调用的能力转成指令跟随行为。

2. 少量对齐数据为何有效

LIMA: Less Is More for Alignment 表明,只用约一千条精心选择的监督样本,也能让强基础模型形成良好的对话行为。其核心假设是:知识和能力主要来自预训练,对齐阶段主要学习输出格式和交互风格。

课件同时强调,不能把这个结论简单理解为“数据越少越好”。基础模型强度、样本质量、任务覆盖和训练目标都会影响结果。Long Is More for Alignment 等研究进一步说明,更丰富、信息密度更高的回答可能提高对齐效果。

2.1 数据质量控制

  • 删除低质量、重复或互相矛盾的指令。
  • 保留覆盖不同任务和回答形式的样本。
  • 用强模型生成候选,再进行筛选和修订。
  • 避免只优化表面风格而损失事实性和推理能力。

AlpaGasus 使用模型筛选 Alpaca 数据,说明较小但更干净的数据子集可以优于完整数据集。

3. 指令能力可能已存在于预训练中

课件列出多项研究,支持“指令跟随具有预训练内生基础”的观点:

这不意味着监督微调不重要,而是说明其作用经常是“重组和显化已有能力”,而非独立创造全部能力。

4. 预训练数据的表述多样性

模型并不会因为某个事实在训练集中出现一次,就稳定地学会在各种问题形式下使用它。课件引用的 Physics of Language Models: Part 3.1 显示,同一知识以多种叙述和问法重复出现,会显著提高模型在新表达下提取知识的能力。

由此得到的数据设计原则是:

  • 不只追求原始 token 数量,也要追求语义覆盖和表达多样性。
  • 对重要概念提供解释、问答、推导、例子和反例等不同视角。
  • 减少机械重复,因为重复文本增加计算量,却不一定增加可迁移能力。

5. 数据规模与计算规模

Llama 3DeepSeek-V3 展示了大规模预训练数据、模型规模和工程优化共同扩展能力的路线。Scaling Data-Constrained Language Models 则讨论在高质量数据有限时如何重复使用数据,以及重复带来的收益递减。

FineWeb 构建了约 15 万亿 token 的清洗网页语料,说明数据去重、过滤和质量评估本身已成为基础模型训练的核心工程。

6. 数据质量、合成数据与重写

6.1 教科书式合成数据

Textbooks Are All You Need 使用具有教学结构的合成数据训练代码模型。重要启示不是“合成数据一定更好”,而是高密度、结构清楚、难度合适的数据可能比随意抓取的网页更有效。

6.2 重写网页数据

Rephrasing the Web 用模型重写网页内容,改善可读性和训练价值。这种方法可以增加表达多样性,但也可能引入生成模型的偏见、错误和风格同质化。

6.3 大规模网页清洗

RefinedWeb 说明经过严格过滤和去重的公开网页数据,也能训练出有竞争力的模型。课件进一步引用有关数据混合与多样性的研究:arXiv:2305.16264arXiv:2409.16295。共同结论是,在计算预算固定时,覆盖更多有差异的信息通常比反复训练高度相似的数据更有效。

7. 模仿强模型的边界

用强模型生成指令数据,是低成本建立聊天模型的常用方案,但存在明确限制:

  • 学生模型受到自身预训练能力上限约束。
  • 模仿回答风格不等于复制知识和推理过程。
  • 生成数据中的错误会被系统性放大。
  • 仅在未知领域注入答案,模型未必能真正吸收。

The False Promise of Imitating Proprietary LLMs 指出,表面相似的对话风格可能掩盖明显的能力差距。Maybe Only 0.5% Data is Needed 相关实验说明,模型已经“部分知道”的数据往往最容易通过微调获得收益;完全超出基础模型能力的数据更难学会。

8. 预训练留下的深层惯性

预训练不仅提供知识,也留下难以消除的行为倾向。Embers of Autoregression 讨论自回归训练目标如何在模型行为中留下持续影响。通过 logit lens 等分析方法,可以观察到某些不希望出现的 token 倾向在中间层已经形成,即使最终输出被对齐策略压制,它们仍可能保留在内部表示中。

因此,后训练可以显著改变外显行为,却未必真正删除预训练形成的知识、偏见或危险模式。这也是越狱、灾难性遗忘和安全回退的重要背景。

9. 重要方法与研究索引

方法 解决的问题 对应研究
少量高质量监督微调 用较少样本激活基础模型能力 LIMA
指令数据筛选 去除低质量样本,提高单位数据价值 AlpaGasus
高信息量回答对齐 比较短回答与长回答的训练价值 Long Is More for Alignment
多表述知识训练 提高知识在新问法下的可提取性 Physics of Language Models 3.1
教科书式合成数据 提高训练数据的信息密度和结构性 Textbooks Are All You Need
网页重写 将低质量网页改写成更适合学习的文本 Rephrasing the Web
网页过滤与去重 构造大规模高质量预训练语料 RefinedWebFineWeb
强模型蒸馏 用教师模型生成监督数据 The False Promise of Imitating Proprietary LLMs
自我奖励 由模型生成并评价训练信号 Self-Rewarding Language Models

10. 本章结论

  1. 大部分通用知识和潜在能力来自预训练,对齐负责让这些能力更容易被调用。
  2. 数据的多样性、密度、真实性和去重质量,与数据总量同样重要。
  3. 用强模型生成数据很有效,但无法绕过学生模型自身的基础能力上限。
  4. 后训练能够压制某些行为,却未必删除预训练中已经形成的内部倾向。

你可能还想看