李宏毅 AI 课程:高效推理与长度控制
整理过度思考、Chain of Draft、隐式思维链、最短正确轨迹和动态推理预算。
文章目录
05 高效推理:更长不等于更好
原始课件:
reason_shorter (v4).pptx(18 页)
1. 问题:推理模型为何越来越长
当训练奖励主要关注最终答案时,模型可以通过增加尝试、检查和重复分析来提高成功率。推理长度因此经常与准确率一起增长,但两者不是简单因果关系:难题本来就会触发更长推理,冗长文本也可能只是模型不确定或反复绕路的表现。
arXiv:2502.12215 按问题难度分析推理长度,说明比较长度时必须控制难度。不能因为长推理在总体数据上正确率较高,就得出“强制所有问题多想都更好”的结论。
2. 过度思考的代价
- 增加延迟和 token 成本。
- 简单问题也重复验证,降低用户体验。
- 长链条提供更多出错机会,后期可能推翻原本正确的答案。
- 生成大量无效文字,使验证器更难定位关键步骤。
- 训练时若把长度当成能力代理,模型会学会迎合指标。
目标应是“在给定预算内得到正确答案”,而不是“生成尽可能长的思维链”。
3. Chain of Draft
Chain of Draft 引导模型使用类似人类草稿的短句和关键词进行推导,省略不影响计算的完整叙述。它保留关键中间状态,同时显著减少 token。
方法要点:
- 要求每一步只记录必要信息。
- 避免重复题目和长篇解释。
- 在最终答案处恢复清晰、完整的表达。
它适合算术和结构清楚的推理任务;对于需要解释依据、审计过程或教学展示的场景,过度压缩会降低可读性。
4. 用工作流约束推理
另一条路线是直接给模型一套解题流程,例如“识别变量—列式—计算—检查”。工作流限制搜索空间,使模型减少无关探索。
这种方法的优势是可控和容易调试,局限是人工流程可能不适合所有问题。对于开放问题,更合理的方式是提供可选策略,让模型根据难度决定是否展开。
5. 最短正确轨迹蒸馏
arXiv:2502.18080 代表一类“从多个正确解中选择较短轨迹进行模仿”的方法:
- 对每个问题采样多条推理。
- 使用答案验证筛出正确轨迹。
- 在正确轨迹中优先选择较短、较直接的版本。
- 用这些轨迹微调学生模型。
它把推理效率直接写入训练数据,但要防止选择到“答案正确、过程不可靠”的捷径。
6. 隐式思维链
Implicit Chain of Thought Reasoning 探索在隐藏状态中完成部分推理,减少显式输出 token。隐式推理可能降低延迟,也避免把冗长过程展示给用户,但更难解释、监督和验证。
实际系统可以采用混合方案:内部使用压缩表示或隐式计算,外部只输出必要的依据、可核验步骤和最终答案。
7. 在强化学习中控制长度
DeepSeek-R1 说明结果奖励可以自然产生长推理,但如果奖励不包含成本,模型没有动力保持简洁。因此可以加入:
- 每 token 成本或长度惩罚。
- 按问题难度设置动态预算。
- 对“提前得到正确答案”提供额外奖励。
- 惩罚重复片段、无进展循环和无意义自检。
- 同时约束正确性、可读性和效率。
arXiv:2503.04697、arXiv:2501.12570、arXiv:2501.12599 与 arXiv:2502.04463 分别探索长度控制、预算约束和高效推理训练。
8. 推理预算的实践策略
可以先估计问题难度,再选择计算模式:
| 难度 | 推荐策略 |
|---|---|
| 简单事实或格式转换 | 直接回答,不展开搜索 |
| 常规计算与多步任务 | 短思维链或固定工作流 |
| 高难数学、代码与规划 | 多候选、验证器或树搜索 |
| 高风险决策 | 增加验证、工具检查和证据引用,而非只增加文字长度 |
系统应监控的指标包括:准确率、平均推理 token、延迟、单位正确答案成本、重复率,以及不同难度分组下的收益。
9. 重要方法与研究索引
| 方法 | 核心作用 | 对应研究 |
|---|---|---|
| 难度分组分析 | 区分“题难所以长”和“长所以正确” | arXiv:2502.12215 |
| Chain of Draft | 用草稿式短步骤保留必要推理 | arXiv:2502.18600 |
| 最短正确轨迹蒸馏 | 从正确候选中学习更短路径 | arXiv:2502.18080 |
| 隐式思维链 | 将部分推理放入隐藏状态 | arXiv:2405.14838 |
| 长度感知强化学习 | 在正确性之外优化 token 成本 | arXiv:2503.04697 |
10. 本章结论
- 推理长度是计算量,不是能力本身。
- 衡量长推理收益时必须控制问题难度。
- 草稿式推理、工作流、轨迹筛选和隐式推理都能降低成本。
- 强化学习若不显式计算成本,容易产生无效的过度思考。
- 最合理的系统会按任务难度动态分配推理预算。