摘要
针对强化学习提升大模型推理能力时引发的“过度思考”及冗长推理链问题,本文提出隐式压缩正则化(ICR)方法。现有长度惩罚或早退策略存在降低准确率或错误截断的局限。ICR 利用 rollout 组中最短正确回答诱导出的虚拟短分布作为压缩信号,引导策略生成简洁且正确的推理轨迹。实验表明,该方法在显著缩短回复长度的同时保持甚至提升了准确率,实现了更优的准确性 - 长度帕累托前沿。
AI 推荐理由
论文核心解决 LLM 推理中的过度思考问题,提出新正则化方法以优化推理轨迹长度与准确性的平衡。
研究机构
学院软件, 南开大学
哈尔滨工业大学
中国科学院自动化研究所
北京科技大学
东北师范大学
论文信息