摘要
检索增强生成(RAG)是获取外部知识的关键方法,但在处理复杂多跳问题时,单轮检索往往不足。现有方法虽结合多轮迭代检索与推理,仍面临检索路径模糊及强化学习奖励稀疏等挑战。为此,本文提出 APEX-Searcher,一种新颖的智能体规划与执行框架。该框架将检索过程解耦为规划与执行两阶段:首先利用特定分解奖励的强化学习优化战略规划;随后基于子任务分解,通过高质量多跳轨迹的监督微调赋予模型鲁棒的迭代执行能力。实验表明,该方法在多跳 RAG 及任务规划基准上均显著提升性能。
AI 推荐理由
论文提出基于智能体规划与执行的框架,核心在于任务分解与战略规划优化。
研究机构
中国科学院自动化研究所
中国科学院大学
万维科技有限公司
论文信息