摘要
针对现有基于可验证奖励强化学习(RLVR)训练代理式检索增强生成(RAG)系统时,均匀采样轨迹忽略搜索深度差异的问题,本文提出 CuSearch 框架。该方法利用搜索深度贪婪分配(SDGA)算子,将更新预算重新分配至包含更多决策点的深层搜索轨迹,从而提供更密集的监督信号。通过隐式或显式的课程学习机制,CuSearch 自适应地聚焦于高价值轨迹。实验表明,该方法显著提升了模型性能,证明了搜索深度是衡量检索监督密度的有效代理指标。
AI 推荐理由
论文核心研究基于搜索深度的轨迹采样,直接优化 Agent 在 RAG 中的多步检索规划策略。
研究机构
Nanjing University
Shanghai Artificial Intelligence Laboratory
University of Hong Kong
Peking University
论文信息