Reinforcement Learning Long-Context Reasoning Verifiable Rewards
摘要

针对现有可验证奖励强化学习(RLVR)在长上下文场景中因依赖内部参数知识而失效的问题,本文指出仅基于最终答案的稀疏奖励导致上下文定位梯度消失。为此,提出 LongRLVR 方法,引入稠密且可验证的上下文奖励作为辅助信号,直接激励模型选择正确的依据信息。实验表明,该方法在多种模型和基准测试中显著优于标准 RLVR,有效解锁了大模型在长上下文应用中的完整推理潜力。

AI 推荐理由

论文核心解决长上下文下的推理 grounding 问题,通过新奖励机制显著提升推理能力。

研究机构
新加坡国立大学 MiroMind AI 绝对AI
论文信息
作者 Guanzheng Chen, Michael Qizhe Shieh, Lidong Bing
发布日期 2026-03-02
arXiv ID 2603.02146
相关性评分 9/10 (高度相关)