摘要
强化学习后训练虽提升了大语言模型的推理能力,但常生成冗长、重复或语义模糊的推理轨迹。现有方法多通过显式预算或长度奖励调节响应长度,缺乏对中间推理内容的监督。本文提出 CLORE,一种通过编辑正确策略 rollout 来提升推理效率的内容级优化框架。该方法利用外部增强模型删除重复、不可读或无关内容及解出后的冗余步骤,同时保留最终答案。实验表明,CLORE 在多个数学基准上显著改善了准确率与效率的权衡,有效减少了无效推理内容。
AI 推荐理由
论文核心聚焦于优化大模型的推理效率,通过内容级删减提升推理轨迹质量。
研究机构
Carnegie Mellon University
University of North Carolina
Northwestern University
University of Pittsburgh
论文信息