Reinforcement Learning Reasoning Experience Replay RLVR
摘要

近期,强化学习已成为提升大语言模型能力的重要途径,尤其是基于可验证奖励的强化学习在推理任务中表现突出。然而,现有方法仅是人类学习的粗略近似。受人类利用外部和内部经验指导探索并将轨迹内化为稳定知识的启发,本文提出双重引导优化框架。该框架构建经验库,联合外部经验与内部知识指导策略探索,形成经验利用与内化的闭环。实验表明,该方法显著优于基线,证明了更好地利用和内化经验能有效提升推理能力。

AI 推荐理由

论文针对 RLVR 推理任务,提出利用内外经验提升模型推理能力的框架,核心聚焦推理优化。

研究机构
iQuest Research 北京理工大学 清华大学
论文信息
作者 Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao et al.
发布日期 2026-03-25
arXiv ID 2603.24093
相关性评分 9/10 (高度相关)