Agentic Planning Multi-hop RAG Reinforcement Learning Task Decomposition
摘要

检索增强生成(RAG)是获取外部知识的关键方法,但在处理复杂多跳问题时,单轮检索往往不足。现有方法虽结合多轮迭代检索与推理,仍面临检索路径模糊及强化学习奖励稀疏等挑战。为此,本文提出 APEX-Searcher,一种新颖的智能体规划与执行框架。该框架将检索过程解耦为规划与执行两阶段:首先利用特定分解奖励的强化学习优化战略规划;随后基于子任务分解,通过高质量多跳轨迹的监督微调赋予模型鲁棒的迭代执行能力。实验表明,该方法在多跳 RAG 及任务规划基准上均显著提升性能。

AI 推荐理由

论文提出基于智能体规划与执行的框架,核心在于任务分解与战略规划优化。

研究机构
中国科学院自动化研究所 中国科学院大学 万维科技有限公司
论文信息
作者 Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao
发布日期 2026-03-14
arXiv ID 2603.13853
相关性评分 9/10 (高度相关)