摘要
针对现有代理强化学习(Agentic RL)依赖纯在线策略导致探索受限的问题,本文提出检索增强策略优化(RAPO)框架。该方法将训练分解为混合策略代理 rollout 和检索感知策略优化两个阶段,利用检索到的离线步骤级轨迹动态扩展推理感受野,并通过检索奖励校准策略梯度。实验表明,RAPO 在三个代理推理任务的十四个数据集上平均提升 5.0%,且训练效率提高 1.2 倍。
AI 推荐理由
论文核心在于通过检索增强策略优化,扩展 Agent 在多步任务中的推理探索空间,提升推理能力。
研究机构
浙江大学
论文信息