Self-Evolving Knowledge Graph Search Agent Intermediate Supervision
摘要

自进化搜索代理通过生成并解决自身搜索任务减少对人类标注数据的依赖。针对现有搜索自博弈(SSP)框架中问题生成缺乏关系语境及求解器仅获二元奖励的瓶颈,本文提出利用知识图谱路径作为中间监督。首先,基于大模型引导的知识图谱子图构建问题以提供关系上下文;其次,引入航点覆盖奖励(WCR),根据求解轨迹对构建路径实体的覆盖程度给予分级部分奖励。实验表明,该方法在多个基准测试中显著提升了多跳问答性能,实现了无需额外人工标注的轻量级过程反馈。

AI 推荐理由

论文核心提出自进化搜索代理框架,通过知识图谱路径优化自我生成任务与奖励机制。

研究机构
Xiaohongshu Inc., Beijing, China
论文信息
作者 Huyu Wu, Jun Liu, Xiaochi Wei, Yan Gao, Yi Wu et al.
发布日期 2026-05-07
arXiv ID 2605.05702
相关性评分 9/10 (高度相关)