李宏毅 AI 课程:推理评估与指标偏差
整理基准污染、模板记忆、ARC-AGI、Chatbot Arena、成本评估和 Goodhart 定律。
文章目录
06 推理评估:污染、偏好偏差与指标失效
原始课件:
reason_eval (v4).pptx(15 页)
1. 为什么推理评估特别困难
推理模型在常用数学和代码基准上取得高分,并不自动说明它获得了通用推理能力。分数可能同时受到以下因素影响:
- 训练数据包含测试题或相似模板。
- 模型记住了解题表面形式,而非抽象规则。
- 评价者偏爱更长、更自信或更友好的回答。
- 公开基准被反复优化后失去区分能力。
- 推理成本极高,但榜单只报告准确率。
因此,评估必须同时测量正确性、泛化、污染、成本和评价偏差。
2. DeepSeek-R1 的评估案例
DeepSeek-R1 在数学、代码和知识任务上报告了强结果。阅读这类结果时,需要区分:
- pass@1:单次生成直接答对的概率。
- 多次采样后的成功率:允许更高测试时成本。
- 使用外部执行器或验证器后的结果。
- 不同模型是否使用相同 token 预算。
只比较最终分数而忽略预算,可能把“花更多计算搜索”误认为“单次推理能力更强”。
3. 基准污染与模板记忆
GSM-Symbolic 对 GSM8K 的题目结构、数字和干扰信息进行系统变化。实验显示,模型在标准题目上的高分可能依赖熟悉模板;稍微改变表达或加入无关条件,就会明显波动。
arXiv:2402.08939 通过重排、反转或改写文本研究记忆影响。若模型对原始顺序表现很好,但对语义等价的新形式显著退化,就要警惕训练污染或表面模式匹配。
3.1 更可靠的污染检查
- 使用训练截止日期之后创建的新题。
- 对题目进行参数化生成,而不是固定题库。
- 保持规则不变,改变实体、顺序、措辞和结构。
- 检查模型是否能解释并迁移规则。
- 搜索训练语料与测试样本的近似重复。
4. ARC-AGI:评估新任务适应
On the Measure of Intelligence 提出 ARC,要求系统从少量输入输出示例中推断新的抽象规则。它强调“面对未知任务时的学习效率”,而不是对已知任务分布的熟练程度。
ARC-AGI 的价值在于任务形式简单但规则变化大;局限是它只覆盖特定的视觉符号变换,而且高分系统可能使用大量搜索、程序合成或高昂计算。评价时应同时报告准确率和每题成本。
5. Chatbot Arena 与成对偏好
Chatbot Arena 让用户盲选两个模型回答中的更好者,再通过 Elo 或 Bradley-Terry 模型估计相对排名。这种方法更接近真实用户偏好,但偏好不是纯粹的能力测量。
用户可能系统性偏爱:
- 更长、更完整的回答。
- 更积极或更有礼貌的语气。
- 使用标题、列表、表情或特定排版的回答。
- 自信表达,即使事实并不更准确。
课件中的 style control 和 sentiment control 说明,可以把回答长度、风格或情感因素作为控制变量,估计排除这些表面因素后的模型质量。
6. Elo 与 Bradley-Terry 的直觉
Bradley-Terry 模型为每个模型分配一个潜在强度,并用两者强度差预测成对获胜概率。Elo 则随每场比较动态更新分数。
这些排名的注意事项包括:
- 分数是相对于参与比较的模型集合,而非绝对能力。
- 用户群体和提示分布变化会改变排名。
- 样本量不足时置信区间很宽。
- 不同任务领域的强弱可能被一个总分掩盖。
7. Goodhart 定律
Goodhart 定律可概括为:当一个指标成为优化目标后,它就不再是可靠的指标。
在推理模型中,典型例子是:
- 优化思维链长度后,模型学会冗长而非正确。
- 优化人类偏好后,模型学会讨好评价者。
- 优化固定题库后,系统针对模板和泄漏信息调参。
- 优化单一安全分数后,模型可能过度拒绝正常请求。
解决方法不是寻找一个永远正确的指标,而是使用多个互补指标、持续更换测试分布,并对异常提升进行因果检查。
8. 推荐的推理评估矩阵
| 维度 | 应测内容 |
|---|---|
| 正确性 | 单次准确率、pass@k、可执行验证结果 |
| 泛化 | 改写、变量替换、新组合和分布外任务 |
| 稳定性 | 多次采样、提示微调和顺序变化下的波动 |
| 效率 | 输出 token、延迟、搜索次数和单位正确成本 |
| 污染 | 精确重复、近似重复、模板重合和时间切分 |
| 人类偏好 | 风格控制、长度控制、事实核验和分领域评价 |
| 安全性 | 错误自信、危险建议和拒答边界 |
9. 重要方法与研究索引
| 方法或基准 | 目的 | 对应研究 |
|---|---|---|
| GSM-Symbolic | 检查数学推理是否依赖固定模板 | arXiv:2410.05229 |
| 文本重排与反转 | 检测记忆和顺序敏感性 | arXiv:2402.08939 |
| ARC-AGI | 测量从少量示例适应新规则的能力 | On the Measure of Intelligence |
| Chatbot Arena | 用真实用户成对比较模型回答 | LMSYS Chatbot Arena |
| 风格控制排名 | 分离长度与表达风格造成的偏好 | Chatbot Arena 风格控制评估 |
| 成本感知评估 | 同时比较正确率与测试时计算 | 推理模型和 ARC-AGI 成本分析 |
10. 本章结论
- 高基准分数可能来自能力、记忆、搜索预算或评价偏差,必须拆开分析。
- 参数化新题、语义等价改写和时间切分是检测污染的重要手段。
- 人类偏好排名会受到长度、风格和情感表达影响。
- 推理模型必须报告计算成本,否则模型之间的比较不公平。
- 任何单一指标一旦成为训练目标,都可能被模型利用,因此需要持续更新、多维评估。