推理效率 强化学习 内容优化 DPO 数学推理
摘要

强化学习后训练虽提升了大语言模型的推理能力,但常生成冗长、重复或语义模糊的推理轨迹。现有方法多通过显式预算或长度奖励调节响应长度,缺乏对中间推理内容的监督。本文提出 CLORE,一种通过编辑正确策略 rollout 来提升推理效率的内容级优化框架。该方法利用外部增强模型删除重复、不可读或无关内容及解出后的冗余步骤,同时保留最终答案。实验表明,CLORE 在多个数学基准上显著改善了准确率与效率的权衡,有效减少了无效推理内容。

AI 推荐理由

论文核心聚焦于优化大模型的推理效率,通过内容级删减提升推理轨迹质量。

研究机构
Carnegie Mellon University University of North Carolina Northwestern University University of Pittsburgh
论文信息
作者 Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang et al.
发布日期 2026-05-21
arXiv ID 2605.22211
相关性评分 9/10 (高度相关)