Agentic RAG Reinforcement Learning Curriculum Learning Search Depth Trajectory Sampling
摘要

针对现有基于可验证奖励强化学习(RLVR)训练代理式检索增强生成(RAG)系统时,均匀采样轨迹忽略搜索深度差异的问题,本文提出 CuSearch 框架。该方法利用搜索深度贪婪分配(SDGA)算子,将更新预算重新分配至包含更多决策点的深层搜索轨迹,从而提供更密集的监督信号。通过隐式或显式的课程学习机制,CuSearch 自适应地聚焦于高价值轨迹。实验表明,该方法显著提升了模型性能,证明了搜索深度是衡量检索监督密度的有效代理指标。

AI 推荐理由

论文核心研究基于搜索深度的轨迹采样,直接优化 Agent 在 RAG 中的多步检索规划策略。

研究机构
Nanjing University Shanghai Artificial Intelligence Laboratory University of Hong Kong Peking University
论文信息
作者 Jianghan Shen, Siqi Luo, Xinyu Cheng, Jing Xiong, Yue Li et al.
发布日期 2026-05-12
arXiv ID 2605.11611
相关性评分 9/10 (高度相关)