摘要
检索增强生成(RAG)虽能引入外部知识,但传统单轮检索难以应对复杂多步推理。代理式 RAG 允许模型动态决定检索时机与内容,然而现有基于强化学习的训练方法面临奖励稀疏及样本效率低下的挑战。本文提出 Search-P1 框架,引入路径中心奖励塑造机制:一是通过顺序无关的步骤覆盖和软评分评估推理轨迹的结构质量,从失败样本中提取学习信号;二是利用离线生成的参考规划器进行双轨路径评分,兼顾自一致性与参考对齐性。实验表明,该方法在多个问答基准上显著优于基线模型。
AI 推荐理由
论文核心解决多步推理中的奖励稀疏问题,通过路径中心奖励塑造优化推理轨迹质量。
研究机构
腾讯
论文信息