摘要
可验证奖励强化学习(RLVR)虽能提升大语言模型推理能力,但常受限于稀疏二元奖励和弱信用分配。为此,本文提出面向修正的策略优化(CIPO),无需外部信号即可将模型自身的失败轨迹转化为修正监督信号。通过联合优化修正样本与标准 RLVR 目标,CIPO 显著提升了学习效率及模型自我纠错能力。在涵盖数学推理与代码生成的 11 个基准测试中,CIPO 表现优于强基线,且 pass@K 指标的提升证明其增强了模型内在推理能力。
AI 推荐理由
论文核心提出利用失败轨迹优化策略,直接提升 LLM 在数学和代码领域的推理与纠错能力。
研究机构
中国信息处理实验室,中国科学院软件研究所
论文信息