跳到正文

06 推理评估:污染、偏好偏差与指标失效

原始课件:reason_eval (v4).pptx(15 页)

1. 为什么推理评估特别困难

推理模型在常用数学和代码基准上取得高分,并不自动说明它获得了通用推理能力。分数可能同时受到以下因素影响:

  • 训练数据包含测试题或相似模板。
  • 模型记住了解题表面形式,而非抽象规则。
  • 评价者偏爱更长、更自信或更友好的回答。
  • 公开基准被反复优化后失去区分能力。
  • 推理成本极高,但榜单只报告准确率。

因此,评估必须同时测量正确性、泛化、污染、成本和评价偏差。

2. DeepSeek-R1 的评估案例

DeepSeek-R1 在数学、代码和知识任务上报告了强结果。阅读这类结果时,需要区分:

  • pass@1:单次生成直接答对的概率。
  • 多次采样后的成功率:允许更高测试时成本。
  • 使用外部执行器或验证器后的结果。
  • 不同模型是否使用相同 token 预算。

只比较最终分数而忽略预算,可能把“花更多计算搜索”误认为“单次推理能力更强”。

3. 基准污染与模板记忆

GSM-Symbolic 对 GSM8K 的题目结构、数字和干扰信息进行系统变化。实验显示,模型在标准题目上的高分可能依赖熟悉模板;稍微改变表达或加入无关条件,就会明显波动。

arXiv:2402.08939 通过重排、反转或改写文本研究记忆影响。若模型对原始顺序表现很好,但对语义等价的新形式显著退化,就要警惕训练污染或表面模式匹配。

3.1 更可靠的污染检查

  • 使用训练截止日期之后创建的新题。
  • 对题目进行参数化生成,而不是固定题库。
  • 保持规则不变,改变实体、顺序、措辞和结构。
  • 检查模型是否能解释并迁移规则。
  • 搜索训练语料与测试样本的近似重复。

4. ARC-AGI:评估新任务适应

On the Measure of Intelligence 提出 ARC,要求系统从少量输入输出示例中推断新的抽象规则。它强调“面对未知任务时的学习效率”,而不是对已知任务分布的熟练程度。

ARC-AGI 的价值在于任务形式简单但规则变化大;局限是它只覆盖特定的视觉符号变换,而且高分系统可能使用大量搜索、程序合成或高昂计算。评价时应同时报告准确率和每题成本。

5. Chatbot Arena 与成对偏好

Chatbot Arena 让用户盲选两个模型回答中的更好者,再通过 Elo 或 Bradley-Terry 模型估计相对排名。这种方法更接近真实用户偏好,但偏好不是纯粹的能力测量。

用户可能系统性偏爱:

  • 更长、更完整的回答。
  • 更积极或更有礼貌的语气。
  • 使用标题、列表、表情或特定排版的回答。
  • 自信表达,即使事实并不更准确。

课件中的 style control 和 sentiment control 说明,可以把回答长度、风格或情感因素作为控制变量,估计排除这些表面因素后的模型质量。

6. Elo 与 Bradley-Terry 的直觉

Bradley-Terry 模型为每个模型分配一个潜在强度,并用两者强度差预测成对获胜概率。Elo 则随每场比较动态更新分数。

这些排名的注意事项包括:

  • 分数是相对于参与比较的模型集合,而非绝对能力。
  • 用户群体和提示分布变化会改变排名。
  • 样本量不足时置信区间很宽。
  • 不同任务领域的强弱可能被一个总分掩盖。

7. Goodhart 定律

Goodhart 定律可概括为:当一个指标成为优化目标后,它就不再是可靠的指标。

在推理模型中,典型例子是:

  • 优化思维链长度后,模型学会冗长而非正确。
  • 优化人类偏好后,模型学会讨好评价者。
  • 优化固定题库后,系统针对模板和泄漏信息调参。
  • 优化单一安全分数后,模型可能过度拒绝正常请求。

解决方法不是寻找一个永远正确的指标,而是使用多个互补指标、持续更换测试分布,并对异常提升进行因果检查。

8. 推荐的推理评估矩阵

维度 应测内容
正确性 单次准确率、pass@k、可执行验证结果
泛化 改写、变量替换、新组合和分布外任务
稳定性 多次采样、提示微调和顺序变化下的波动
效率 输出 token、延迟、搜索次数和单位正确成本
污染 精确重复、近似重复、模板重合和时间切分
人类偏好 风格控制、长度控制、事实核验和分领域评价
安全性 错误自信、危险建议和拒答边界

9. 重要方法与研究索引

方法或基准 目的 对应研究
GSM-Symbolic 检查数学推理是否依赖固定模板 arXiv:2410.05229
文本重排与反转 检测记忆和顺序敏感性 arXiv:2402.08939
ARC-AGI 测量从少量示例适应新规则的能力 On the Measure of Intelligence
Chatbot Arena 用真实用户成对比较模型回答 LMSYS Chatbot Arena
风格控制排名 分离长度与表达风格造成的偏好 Chatbot Arena 风格控制评估
成本感知评估 同时比较正确率与测试时计算 推理模型和 ARC-AGI 成本分析

10. 本章结论

  1. 高基准分数可能来自能力、记忆、搜索预算或评价偏差,必须拆开分析。
  2. 参数化新题、语义等价改写和时间切分是检测污染的重要手段。
  3. 人类偏好排名会受到长度、风格和情感表达影响。
  4. 推理模型必须报告计算成本,否则模型之间的比较不公平。
  5. 任何单一指标一旦成为训练目标,都可能被模型利用,因此需要持续更新、多维评估。

你可能还想看