Tool Use Reinforcement Learning Knowledge Graph Failure Analysis
摘要

本文在极简知识图谱工具 API 上测试标准 RLVR 工具使用方案,发现策略性能呈现“先峰后崩”模式。研究指出,与 Python 解释器等不同,知识图谱空结果缺乏自然语言反馈信号是导致失败的关键。实验表明错误主要源于检索组合而非关系选择。通过单次迭代自蒸馏,7B 模型精确匹配率提升至 40%,且性能上限受限于接口反馈而非模型容量。

AI 推荐理由

论文核心研究 Agent 使用知识图谱工具时的失败模式、接口反馈机制及优化策略。

研究机构
University of York, Department of Computer Science, Heslington, York YO10 5DD
论文信息
作者 Tianda Sun, Dimitar Kazakov
发布日期 2026-05-25
arXiv ID 2605.26037
相关性评分 9/10 (高度相关)