摘要
针对现有可验证奖励强化学习(RLVR)在长上下文场景中因依赖内部参数知识而失效的问题,本文指出仅基于最终答案的稀疏奖励导致上下文定位梯度消失。为此,提出 LongRLVR 方法,引入稠密且可验证的上下文奖励作为辅助信号,直接激励模型选择正确的依据信息。实验表明,该方法在多种模型和基准测试中显著优于标准 RLVR,有效解锁了大模型在长上下文应用中的完整推理潜力。
AI 推荐理由
论文核心解决长上下文下的推理 grounding 问题,通过新奖励机制显著提升推理能力。
研究机构
新加坡国立大学
MiroMind AI
绝对AI
论文信息