RLVR Reasoning Models Rollout Diversity Reinforcement Learning
摘要

可验证奖励强化学习(RLVR)无需标注轨迹即可训练推理模型,但其瓶颈在于 Rollout 的多样性。现有方法多通过调整温度或前缀来扩展探索,而本文发现推理标记后的首个 Token 是被忽视的关键位置。该位置分布尖锐且与正确性解耦,能有效扩展探索区域而不干扰奖励信号。作者提出 REFT 方法,均匀采样策略自身的前 N 个候选首 Token 并平均分配 Rollout。实验表明,该方法在多种基座模型和难度下,显著提升了 Pass@1 至 Pass@64 指标。

AI 推荐理由

论文核心研究通过优化 RLVR 中的 rollout 多样性来提升模型的推理能力,直接针对推理路径探索。

研究机构
延世大学人工智能系
论文信息
作者 Soeun Kim, Albert No
发布日期 2026-05-27
arXiv ID 2605.28295
相关性评分 9/10 (高度相关)