Reinforcement Learning Reasoning Efficiency Overthinking LLM Post-Training
摘要

针对强化学习提升大模型推理能力时引发的“过度思考”及冗长推理链问题,本文提出隐式压缩正则化(ICR)方法。现有长度惩罚或早退策略存在降低准确率或错误截断的局限。ICR 利用 rollout 组中最短正确回答诱导出的虚拟短分布作为压缩信号,引导策略生成简洁且正确的推理轨迹。实验表明,该方法在显著缩短回复长度的同时保持甚至提升了准确率,实现了更优的准确性 - 长度帕累托前沿。

AI 推荐理由

论文核心解决 LLM 推理中的过度思考问题,提出新正则化方法以优化推理轨迹长度与准确性的平衡。

研究机构
学院软件, 南开大学 哈尔滨工业大学 中国科学院自动化研究所 北京科技大学 东北师范大学
论文信息
作者 Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai et al.
发布日期 2026-05-08
arXiv ID 2605.07316
相关性评分 9/10 (高度相关)