摘要
大型推理语言模型(LRLMs)利用长思维链在复杂任务中表现优异,但易产生冗余步骤导致“过思考”,降低性能与效率。现有早期退出策略或依赖代理模型增加训练开销,或因频繁切换内容限制推理吞吐,且常因过度截断损害性能。本文观察到过思考常伴随高熵转移 token 导致的推理路径偏离,据此提出一种与原生生推理过程深度耦合的早期退出方法。该方法利用路径偏离指数作为监控指标,动态检测并终止过思考轨迹。多基准实验表明,相比现有方法,本方法在提升性能方面效果最显著。
AI 推荐理由
论文核心研究大推理模型中的思维链过思考问题,提出基于推理路径偏离的监控机制。
研究机构
中国科学院信息工程研究所
中国科学院大学网络空间安全学院
论文信息