Reinforcement Learning Credit Assignment Search Agents Long-horizon Planning
摘要

针对基于大语言模型的搜索智能体在长程任务中面临的奖励稀疏、信用孤立及分布偏移挑战,本文提出 PiCA 方法。该方法将搜索轨迹重构为累积进步过程,利用潜在奖励塑造识别关键“枢轴”步骤(即显著提升最终答案概率的子查询与子回答)。通过锚定最终目标,PiCA 提供了密集且依赖轨迹的引导,同时保持分布一致性。实验表明,该方法在多个知识密集型问答基准上显著优于现有基线。

AI 推荐理由

论文核心解决搜索智能体长程任务中的信用分配问题,优化多步搜索轨迹规划。

研究机构
香港科技大学(广州)
论文信息
作者 Dongyi Liu, Yifan Niu, Qinwen Wang, Han Xiao, Jia Li
发布日期 2026-05-10
arXiv ID 2605.09287
相关性评分 9/10 (高度相关)