摘要
本文在极简知识图谱工具 API 上测试标准 RLVR 工具使用方案,发现策略性能呈现“先峰后崩”模式。研究指出,与 Python 解释器等不同,知识图谱空结果缺乏自然语言反馈信号是导致失败的关键。实验表明错误主要源于检索组合而非关系选择。通过单次迭代自蒸馏,7B 模型精确匹配率提升至 40%,且性能上限受限于接口反馈而非模型容量。
AI 推荐理由
论文核心研究 Agent 使用知识图谱工具时的失败模式、接口反馈机制及优化策略。
研究机构
University of York, Department of Computer Science, Heslington, York YO10 5DD
论文信息