跳到正文

09 模型编辑:定点修改知识与行为

原始课件:edit (v5).pptx(34 页)

1. 模型编辑与普通微调的区别

普通微调通常希望模型学习一批新任务或新分布;模型编辑则希望只修改一个或少数事实、规则或行为,同时尽量不影响其他内容。

一个编辑方法至少需要回答三类问题:

  1. 可靠性:目标知识是否真的被改写。
  2. 泛化性:换一种问法、改写句子或改变关系方向后,修改是否仍然生效。
  3. 局部性:无关知识、相邻事实和原有能力是否保持不变。

实际评估还应加入编辑持久性、多次编辑冲突、跨语言效果和安全副作用。

2. 无参数编辑:上下文学习

IKE: In-Context Knowledge Editing 通过在提示中放入“旧事实—新事实”示例,让模型在当前上下文里采用新知识。它不改变参数,因此:

  • 优点:快速、可回滚、不会永久破坏模型。
  • 缺点:每次调用都要携带编辑示例;离开上下文后修改消失;多个编辑会占用上下文并可能冲突。

无参数方法适合临时事实、用户个性化设置和需要审计回滚的场景。

3. ROME:定位并修改事实关联

Locating and Editing Factual Associations in GPT(ROME)把事实问答近似为模型中某层前馈网络的键值关联:

  1. 用因果追踪定位事实信息主要影响的层和 token 位置。
  2. 计算新事实应当激活的目标表示。
  3. 求解一个低秩参数更新,使新事实写入对应 MLP。
  4. 在保持原权重尽量不变的约束下完成编辑。

ROME 的优点是单次编辑简单、修改量小;局限是对事实结构和编辑位置有假设,连续大量编辑时可能出现冲突、泛化不足或局部性破坏。

4. 学习型编辑器

手工设计编辑规则难以覆盖不同模型和任务,因此出现了元学习或超网络编辑器:

  1. 输入待编辑事实、原模型梯度或激活差异。
  2. 编辑器预测参数增量。
  3. 将增量应用到目标模型。
  4. 用可靠性、泛化和局部性联合训练编辑器。

4.1 MEND

MEND 不直接对整个模型执行昂贵的梯度优化,而是学习把原始梯度转换成可用的低秩更新。它通过分解梯度降低编辑成本,并让同一编辑器迁移到多个编辑样本。

学习型编辑器速度快、可批量化,但训练分布和目标模型变化会影响泛化;编辑器也可能学到数据集特定的捷径。

5. 评估指标与测试设计

5.1 可靠性

编辑后直接询问目标事实,检查模型是否输出新答案。要区分“回答格式改变”和“知识确实改变”,最好使用多种提示模板。

5.2 泛化

  • 同义改写:换一种自然表达。
  • 逆向关系:把主客体或问法方向反转。
  • 组合推理:将新事实放进多跳问题。
  • 跨语言:用另一种语言提问。

5.3 局部性

检查无关事实、相邻实体、常识问答、格式输出和安全行为是否变化。编辑一个人物属性时,不能让模型同时改变其他人物、时间或地点。

5.4 持久性与冲突

重启模型、增加上下文、连续执行多个编辑后重复测试,观察修改是否保持,以及冲突编辑如何解决。

KnowEdit 等基准把多种编辑任务、模型和指标统一起来,便于比较不同方法。

6. 模型编辑与内部机制的联系

ROME 的思路来自内部可解释性:先用因果追踪定位信息,再执行最小参数修改。反过来,编辑成功也可以作为机制验证:如果只改动被定位的组件就能改变目标事实,同时保持其他事实不变,说明定位至少在该实验范围内有因果意义。

因此,编辑不应被当成纯工程技巧;它也是测试“知识存储在哪里、如何被检索”的实验工具。

7. 适用场景与风险

适用场景:

  • 更新过时人物、地点、产品或政策信息。
  • 注入企业内部术语和特定事实。
  • 修正单个错误知识。
  • 定点修改不安全或不合规行为。

风险:

  • 编辑可能污染相关知识簇。
  • 多次编辑的顺序会影响结果。
  • 新事实可能与预训练分布冲突,导致模型不稳定。
  • 参数修改难以完全回滚,必须保存原模型和编辑日志。

8. 方法比较

方法 是否改参数 优点 主要限制
IKE 快速、可回滚、无永久副作用 依赖上下文,不能持久保存
ROME 单事实编辑直接、修改量小 依赖定位假设,多编辑可能冲突
MEND 学习型、可批量、编辑速度快 需要训练编辑器,存在分布外风险
全参数微调 表达能力强、适合批量任务 容易影响无关知识和原有行为

9. 本章结论

  1. 模型编辑的核心不是“改对一个答案”,而是同时满足可靠性、泛化性和局部性。
  2. 无参数编辑适合临时覆盖;参数编辑适合持久修改,但必须记录和验证副作用。
  3. ROME 代表基于内部定位的直接编辑,MEND 代表学习型编辑器路线。
  4. 多事实、跨语言和安全编辑仍是开放问题,不能只依赖单题准确率。

你可能还想看