李宏毅 AI 课程:生成式人工智能与基础模型总览
从自回归生成、Transformer 和 Mamba 到预训练、对齐、推理与 AI Agent 的课程总览。
文章目录
01 生成式人工智能与基础模型总览
原始课件:
introduction-v14.pptx(93 页)
1. 课程主线
生成式人工智能的核心任务,是把文本、图像、声音、视频等复杂对象表示成一串可处理的单元,再根据已有上下文预测下一个单元。大型语言模型只是这一思想在文本上的典型实现;只要能设计合适的表示与生成顺序,同一框架也可以用于图像、音乐、语音和多模态内容。
课程后续内容围绕四个问题展开:
- 模型如何通过预训练获得广泛能力。
- 如何用监督微调和人类反馈,让模型按人的意图工作。
- 如何让模型进行更长的推理、使用工具并成为智能体。
- 如何理解、编辑、合并和扩展已经训练好的模型。
2. 自回归生成:从对象到序列
2.1 基本流程
自回归模型反复执行以下步骤:
- 将对象编码为离散或连续的表示单元。
- 输入目前已有的单元序列。
- 预测下一个单元的概率分布。
- 采样或选择一个单元并接到序列末尾。
- 重复直到生成结束。
文本中的单元通常称为 token。图像可以被表示为视觉 token,音频可以被表示为声学或语义 token。因此,“下一个 token 预测”并不只属于语言模型,而是一种通用生成范式。
2.2 关键限制
- 模型学到的是数据分布中的统计规律,不天然保证事实正确。
- 每一步生成都依赖之前的输出,早期错误会向后传播。
- 逐 token 生成使推理成本随输出长度增加。
- 训练目标是局部预测,但用户期待的是全局正确、可靠和可控的结果,两者并不完全一致。
3. 神经网络、深度学习与模型规模
神经网络由多层参数化变换组成。训练通过大量样本调整参数,使模型的预测接近真实答案。所谓“深度”,既可以是网络层数,也可以从更广义的角度理解为计算过程的长度。
课件强调了一个重要变化:当固定网络深度不足以解决复杂问题时,可以让模型在测试阶段生成更长的中间推理过程,以时间和 token 换取能力。这就是测试时计算扩展的重要直觉。
相关研究:
- Scaling Up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach:通过重复计算增加有效推理深度。
- s1: Simple Test-Time Scaling:展示通过简单的数据和推理预算控制,也能获得明显的测试时扩展效果。
4. Transformer、Mamba 与序列建模
4.1 Transformer
Transformer 使用自注意力直接比较序列中不同位置的信息,训练并行性好,也是当前大型语言模型的主流架构。它的主要代价是长序列注意力的计算量通常随长度平方增长,生成时还需要保存不断增长的键值缓存。
4.2 Mamba 与状态空间模型
Mamba 类模型把历史压缩进固定大小的状态,并通过输入相关的选择机制决定保留或遗忘什么。它试图同时取得两类模型的优点:训练时可并行,推理时不必保存完整历史缓存。
架构决定模型如何计算,参数则记录训练中形成的具体行为。相同架构在不同数据和训练流程下,可以得到能力完全不同的模型。
5. 基础模型如何形成
5.1 预训练
预训练使用大规模未标注数据训练下一个 token 预测。模型由此获得语言规律、世界知识、模式匹配能力以及一部分潜在的推理和工具使用能力。
5.2 监督微调
监督微调使用“指令—理想回答”样本,把基础模型已有的能力组织成对用户可用的交互行为。微调数据可以远少于预训练数据,但数据质量、覆盖范围和回答风格非常重要。
5.3 偏好对齐
RLHF、奖励模型以及直接偏好优化等方法,用人类偏好信号进一步调整模型,使回答更有帮助、更安全、更符合要求。对齐主要改变模型“何时、以何种方式使用能力”,并不等同于从零教会模型所有知识。
6. 从专用模型到通用模型
模型发展的重要方向是减少“一项任务一个模型”的需求:
- 早期方法针对每项任务分别训练。
- 预训练编码器让多个任务共享表示,再分别微调。
- 指令微调让同一个参数集合通过自然语言指令切换任务。
- 多模态模型进一步把文本、图像、声音等统一到一个交互接口中。
The Natural Language Decathlon 是多任务统一建模的代表性早期研究。语音领域的 SUPERB 则用统一基准评估同一语音表示对多类任务的迁移能力。
7. 课程涉及的能力边界
7.1 推理模型
推理模型通过生成中间步骤、搜索多个候选、验证答案和增加测试时计算来处理复杂任务。推理长度不是目标本身,真正目标是在有限预算下提高正确率。
7.2 AI 智能体
智能体把模型放进“目标—行动—观察”的循环中。模型不再只生成文字,还可以调用工具、浏览网页、操作计算机、维护记忆并根据反馈调整计划。
7.3 语音与多模态模型
语音模型除了内容,还要处理说话人、情绪、韵律和环境信息。BreezyVoice 等研究说明,大型语言模型的生成能力可以与语音 token 和解码器结合,形成可控的语音生成系统。
7.4 模型持续演化
模型部署后仍可能需要加入新知识、新任务或新安全约束。主要路线包括:
- 后训练与持续学习:继续优化现有参数。
- 模型编辑:定点修改某条知识或行为。
- 模型合并:组合多个微调模型的能力。
- 可解释性:定位模型内部表示和功能回路。
8. 重要方法与研究索引
| 方法或主题 | 核心作用 | 对应研究 |
|---|---|---|
| 自回归生成 | 将复杂生成统一为逐 token 预测 | GPT 系列及各类离散生成模型 |
| 参数共享 | 减少模型规模并提高训练效率 | ALBERT |
| 多任务统一建模 | 用同一模型处理不同自然语言任务 | Natural Language Decathlon |
| 零样本跨语言迁移 | 在未提供直接监督时迁移到新语言对 | Google Multilingual NMT |
| 测试时计算扩展 | 用更多推理步骤提升复杂任务表现 | s1 |
| 语音基础模型评测 | 统一比较语音表示的通用性 | SUPERB |
| 语音生成基础模型 | 结合语言模型与语音表示进行生成 | BreezyVoice |
9. 本章结论
- 生成式人工智能的共同基础,是把对象表示成序列并预测后续单元。
- 预训练提供广泛潜能,对齐训练把潜能转化为可交互的行为。
- 更大的模型不是唯一扩展方向,测试时计算、工具、记忆和外部环境同样重要。
- 后续章节中的推理、智能体、语音、编辑和合并,都是在基础模型之上重新组织或扩展能力。