摘要
大型推理模型(LRM)通过思维链(CoT)推理在复杂任务中表现优异,但常存在过度思考问题,导致计算资源浪费。现有研究表明存在最优推理长度,但确定该长度极具挑战。本文提出 TERMINATOR,一种用于 LRM 推理阶段的早期退出策略。其核心思想是利用模型首次生成最终答案的可预测性,构建最优推理长度数据集进行训练。实验表明,TERMINATOR 在四个高难度数据集上将 CoT 长度平均缩短了 14%-55%,同时性能优于当前最先进方法。
AI 推荐理由
论文核心研究思维链推理中的过早停止机制,直接优化推理过程效率。
研究机构
UT Ausin, US-EPFL, Switzerland
ENS Paris-Saclay, France
Telecom Paris (IP Paris), France
论文信息