Reinforcement Learning Reasoning Exploration Inverse Reinforcement Learning Pass@k
摘要

强化学习(RL)虽能利用规则奖励训练推理模型,但往往过度集中概率于高奖励轨迹,限制了多样化推理路径的探索,从而影响多采样性能(Pass@k)。本文提出引导概率压缩(SPS)方法,通过交替使用常规 RL 与逆强化学习(IRL),将在线滚动数据视为演示,显式重塑轨迹分布以增强探索。在五个推理基准上的实验表明,SPS 显著提升了探索能力及 Pass@k 指标,并揭示了基于 RL 的推理模型内在的探索上限。

AI 推荐理由

论文核心解决推理模型在 RL 训练中的探索不足问题,直接提升多采样推理性能。

研究机构
东北大学 中国科学院心理研究所 北京独立研究员
论文信息
作者 Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng et al.
发布日期 2026-04-18
arXiv ID 2604.16995
相关性评分 9/10 (高度相关)