摘要
强化学习(RL)虽能利用规则奖励训练推理模型,但往往过度集中概率于高奖励轨迹,限制了多样化推理路径的探索,从而影响多采样性能(Pass@k)。本文提出引导概率压缩(SPS)方法,通过交替使用常规 RL 与逆强化学习(IRL),将在线滚动数据视为演示,显式重塑轨迹分布以增强探索。在五个推理基准上的实验表明,SPS 显著提升了探索能力及 Pass@k 指标,并揭示了基于 RL 的推理模型内在的探索上限。
AI 推荐理由
论文核心解决推理模型在 RL 训练中的探索不足问题,直接提升多采样推理性能。
研究机构
东北大学
中国科学院心理研究所
北京独立研究员
论文信息