跳到正文

李宏毅 AI 课程:生成式人工智能与基础模型总览

从自回归生成、Transformer 和 Mamba 到预训练、对齐、推理与 AI Agent 的课程总览。

10 分钟阅读

01 生成式人工智能与基础模型总览

原始课件:introduction-v14.pptx(93 页)

1. 课程主线

生成式人工智能的核心任务,是把文本、图像、声音、视频等复杂对象表示成一串可处理的单元,再根据已有上下文预测下一个单元。大型语言模型只是这一思想在文本上的典型实现;只要能设计合适的表示与生成顺序,同一框架也可以用于图像、音乐、语音和多模态内容。

课程后续内容围绕四个问题展开:

  1. 模型如何通过预训练获得广泛能力。
  2. 如何用监督微调和人类反馈,让模型按人的意图工作。
  3. 如何让模型进行更长的推理、使用工具并成为智能体。
  4. 如何理解、编辑、合并和扩展已经训练好的模型。

2. 自回归生成:从对象到序列

2.1 基本流程

自回归模型反复执行以下步骤:

  1. 将对象编码为离散或连续的表示单元。
  2. 输入目前已有的单元序列。
  3. 预测下一个单元的概率分布。
  4. 采样或选择一个单元并接到序列末尾。
  5. 重复直到生成结束。

文本中的单元通常称为 token。图像可以被表示为视觉 token,音频可以被表示为声学或语义 token。因此,“下一个 token 预测”并不只属于语言模型,而是一种通用生成范式。

2.2 关键限制

  • 模型学到的是数据分布中的统计规律,不天然保证事实正确。
  • 每一步生成都依赖之前的输出,早期错误会向后传播。
  • 逐 token 生成使推理成本随输出长度增加。
  • 训练目标是局部预测,但用户期待的是全局正确、可靠和可控的结果,两者并不完全一致。

3. 神经网络、深度学习与模型规模

神经网络由多层参数化变换组成。训练通过大量样本调整参数,使模型的预测接近真实答案。所谓“深度”,既可以是网络层数,也可以从更广义的角度理解为计算过程的长度。

课件强调了一个重要变化:当固定网络深度不足以解决复杂问题时,可以让模型在测试阶段生成更长的中间推理过程,以时间和 token 换取能力。这就是测试时计算扩展的重要直觉。

相关研究:

4. Transformer、Mamba 与序列建模

4.1 Transformer

Transformer 使用自注意力直接比较序列中不同位置的信息,训练并行性好,也是当前大型语言模型的主流架构。它的主要代价是长序列注意力的计算量通常随长度平方增长,生成时还需要保存不断增长的键值缓存。

4.2 Mamba 与状态空间模型

Mamba 类模型把历史压缩进固定大小的状态,并通过输入相关的选择机制决定保留或遗忘什么。它试图同时取得两类模型的优点:训练时可并行,推理时不必保存完整历史缓存。

架构决定模型如何计算,参数则记录训练中形成的具体行为。相同架构在不同数据和训练流程下,可以得到能力完全不同的模型。

5. 基础模型如何形成

5.1 预训练

预训练使用大规模未标注数据训练下一个 token 预测。模型由此获得语言规律、世界知识、模式匹配能力以及一部分潜在的推理和工具使用能力。

5.2 监督微调

监督微调使用“指令—理想回答”样本,把基础模型已有的能力组织成对用户可用的交互行为。微调数据可以远少于预训练数据,但数据质量、覆盖范围和回答风格非常重要。

5.3 偏好对齐

RLHF、奖励模型以及直接偏好优化等方法,用人类偏好信号进一步调整模型,使回答更有帮助、更安全、更符合要求。对齐主要改变模型“何时、以何种方式使用能力”,并不等同于从零教会模型所有知识。

6. 从专用模型到通用模型

模型发展的重要方向是减少“一项任务一个模型”的需求:

  • 早期方法针对每项任务分别训练。
  • 预训练编码器让多个任务共享表示,再分别微调。
  • 指令微调让同一个参数集合通过自然语言指令切换任务。
  • 多模态模型进一步把文本、图像、声音等统一到一个交互接口中。

The Natural Language Decathlon 是多任务统一建模的代表性早期研究。语音领域的 SUPERB 则用统一基准评估同一语音表示对多类任务的迁移能力。

7. 课程涉及的能力边界

7.1 推理模型

推理模型通过生成中间步骤、搜索多个候选、验证答案和增加测试时计算来处理复杂任务。推理长度不是目标本身,真正目标是在有限预算下提高正确率。

7.2 AI 智能体

智能体把模型放进“目标—行动—观察”的循环中。模型不再只生成文字,还可以调用工具、浏览网页、操作计算机、维护记忆并根据反馈调整计划。

7.3 语音与多模态模型

语音模型除了内容,还要处理说话人、情绪、韵律和环境信息。BreezyVoice 等研究说明,大型语言模型的生成能力可以与语音 token 和解码器结合,形成可控的语音生成系统。

7.4 模型持续演化

模型部署后仍可能需要加入新知识、新任务或新安全约束。主要路线包括:

  • 后训练与持续学习:继续优化现有参数。
  • 模型编辑:定点修改某条知识或行为。
  • 模型合并:组合多个微调模型的能力。
  • 可解释性:定位模型内部表示和功能回路。

8. 重要方法与研究索引

方法或主题 核心作用 对应研究
自回归生成 将复杂生成统一为逐 token 预测 GPT 系列及各类离散生成模型
参数共享 减少模型规模并提高训练效率 ALBERT
多任务统一建模 用同一模型处理不同自然语言任务 Natural Language Decathlon
零样本跨语言迁移 在未提供直接监督时迁移到新语言对 Google Multilingual NMT
测试时计算扩展 用更多推理步骤提升复杂任务表现 s1
语音基础模型评测 统一比较语音表示的通用性 SUPERB
语音生成基础模型 结合语言模型与语音表示进行生成 BreezyVoice

9. 本章结论

  1. 生成式人工智能的共同基础,是把对象表示成序列并预测后续单元。
  2. 预训练提供广泛潜能,对齐训练把潜能转化为可交互的行为。
  3. 更大的模型不是唯一扩展方向,测试时计算、工具、记忆和外部环境同样重要。
  4. 后续章节中的推理、智能体、语音、编辑和合并,都是在基础模型之上重新组织或扩展能力。

你可能还想看