李宏毅 AI 课程:模型编辑
整理 IKE、ROME、MEND 等模型编辑方法,以及可靠性、泛化性和局部性评估。
文章目录
09 模型编辑:定点修改知识与行为
原始课件:
edit (v5).pptx(34 页)
1. 模型编辑与普通微调的区别
普通微调通常希望模型学习一批新任务或新分布;模型编辑则希望只修改一个或少数事实、规则或行为,同时尽量不影响其他内容。
一个编辑方法至少需要回答三类问题:
- 可靠性:目标知识是否真的被改写。
- 泛化性:换一种问法、改写句子或改变关系方向后,修改是否仍然生效。
- 局部性:无关知识、相邻事实和原有能力是否保持不变。
实际评估还应加入编辑持久性、多次编辑冲突、跨语言效果和安全副作用。
2. 无参数编辑:上下文学习
IKE: In-Context Knowledge Editing 通过在提示中放入“旧事实—新事实”示例,让模型在当前上下文里采用新知识。它不改变参数,因此:
- 优点:快速、可回滚、不会永久破坏模型。
- 缺点:每次调用都要携带编辑示例;离开上下文后修改消失;多个编辑会占用上下文并可能冲突。
无参数方法适合临时事实、用户个性化设置和需要审计回滚的场景。
3. ROME:定位并修改事实关联
Locating and Editing Factual Associations in GPT(ROME)把事实问答近似为模型中某层前馈网络的键值关联:
- 用因果追踪定位事实信息主要影响的层和 token 位置。
- 计算新事实应当激活的目标表示。
- 求解一个低秩参数更新,使新事实写入对应 MLP。
- 在保持原权重尽量不变的约束下完成编辑。
ROME 的优点是单次编辑简单、修改量小;局限是对事实结构和编辑位置有假设,连续大量编辑时可能出现冲突、泛化不足或局部性破坏。
4. 学习型编辑器
手工设计编辑规则难以覆盖不同模型和任务,因此出现了元学习或超网络编辑器:
- 输入待编辑事实、原模型梯度或激活差异。
- 编辑器预测参数增量。
- 将增量应用到目标模型。
- 用可靠性、泛化和局部性联合训练编辑器。
4.1 MEND
MEND 不直接对整个模型执行昂贵的梯度优化,而是学习把原始梯度转换成可用的低秩更新。它通过分解梯度降低编辑成本,并让同一编辑器迁移到多个编辑样本。
学习型编辑器速度快、可批量化,但训练分布和目标模型变化会影响泛化;编辑器也可能学到数据集特定的捷径。
5. 评估指标与测试设计
5.1 可靠性
编辑后直接询问目标事实,检查模型是否输出新答案。要区分“回答格式改变”和“知识确实改变”,最好使用多种提示模板。
5.2 泛化
- 同义改写:换一种自然表达。
- 逆向关系:把主客体或问法方向反转。
- 组合推理:将新事实放进多跳问题。
- 跨语言:用另一种语言提问。
5.3 局部性
检查无关事实、相邻实体、常识问答、格式输出和安全行为是否变化。编辑一个人物属性时,不能让模型同时改变其他人物、时间或地点。
5.4 持久性与冲突
重启模型、增加上下文、连续执行多个编辑后重复测试,观察修改是否保持,以及冲突编辑如何解决。
KnowEdit 等基准把多种编辑任务、模型和指标统一起来,便于比较不同方法。
6. 模型编辑与内部机制的联系
ROME 的思路来自内部可解释性:先用因果追踪定位信息,再执行最小参数修改。反过来,编辑成功也可以作为机制验证:如果只改动被定位的组件就能改变目标事实,同时保持其他事实不变,说明定位至少在该实验范围内有因果意义。
因此,编辑不应被当成纯工程技巧;它也是测试“知识存储在哪里、如何被检索”的实验工具。
7. 适用场景与风险
适用场景:
- 更新过时人物、地点、产品或政策信息。
- 注入企业内部术语和特定事实。
- 修正单个错误知识。
- 定点修改不安全或不合规行为。
风险:
- 编辑可能污染相关知识簇。
- 多次编辑的顺序会影响结果。
- 新事实可能与预训练分布冲突,导致模型不稳定。
- 参数修改难以完全回滚,必须保存原模型和编辑日志。
8. 方法比较
| 方法 | 是否改参数 | 优点 | 主要限制 |
|---|---|---|---|
| IKE | 否 | 快速、可回滚、无永久副作用 | 依赖上下文,不能持久保存 |
| ROME | 是 | 单事实编辑直接、修改量小 | 依赖定位假设,多编辑可能冲突 |
| MEND | 是 | 学习型、可批量、编辑速度快 | 需要训练编辑器,存在分布外风险 |
| 全参数微调 | 是 | 表达能力强、适合批量任务 | 容易影响无关知识和原有行为 |
9. 本章结论
- 模型编辑的核心不是“改对一个答案”,而是同时满足可靠性、泛化性和局部性。
- 无参数编辑适合临时覆盖;参数编辑适合持久修改,但必须记录和验证副作用。
- ROME 代表基于内部定位的直接编辑,MEND 代表学习型编辑器路线。
- 多事实、跨语言和安全编辑仍是开放问题,不能只依赖单题准确率。