Reinforcement Learning LLM Agents Exploration Strategy Retrieval-Augmented Reasoning
摘要

针对现有代理强化学习(Agentic RL)依赖纯在线策略导致探索受限的问题,本文提出检索增强策略优化(RAPO)框架。该方法将训练分解为混合策略代理 rollout 和检索感知策略优化两个阶段,利用检索到的离线步骤级轨迹动态扩展推理感受野,并通过检索奖励校准策略梯度。实验表明,RAPO 在三个代理推理任务的十四个数据集上平均提升 5.0%,且训练效率提高 1.2 倍。

AI 推荐理由

论文核心在于通过检索增强策略优化,扩展 Agent 在多步任务中的推理探索空间,提升推理能力。

研究机构
浙江大学
论文信息
作者 Siwei Zhang, Yun Xiong, Xi Chen, Zi'an Jia, Renhong Huang et al.
发布日期 2026-03-03
arXiv ID 2603.03078
相关性评分 9/10 (高度相关)