摘要
大型推理模型(LRMs)虽能通过长思维链在复杂任务中取得高精度,但常伴随“过度思考”现象,即在得出正确答案后仍生成冗余步骤,导致延迟增加、成本上升及答案漂移。现有方法依赖繁重的训练或手工启发式规则。本文提出 ROM,首次将过度思考缓解建模为流式预测与控制问题。该方法在冻结的大模型后端附加轻量检测头,实时监控令牌并在检测到过度思考时触发提前终止。引入基于正确性边界的令牌级监督及数据增强策略。实验表明,ROM 在七个基准测试中准确率最高,响应长度减少 47.2%,效率提升 121%。
AI 推荐理由
论文核心解决大推理模型中的过度思考问题,优化思维链生成过程,直接提升推理效率与质量。
研究机构
威斯康星大学麦迪逊分校
约翰霍普金斯大学
论文信息