Tool Retrieval Vague Instructions Agent Skills Benchmark
摘要

针对大语言模型在真实场景中面临指令模糊导致工具检索失效的问题,本文构建了模拟人类模糊指令的新基准 VGToolBench。分析表明模糊指令显著降低检索性能。为此,提出工具检索桥(TRB)方法,引入桥接模型将模糊指令重写为具体指令,以弥合指令与检索器偏好间的差距。实验显示,TRB 能有效消除歧义,使 BM25 等基线检索器的平均 NDCG 分数提升高达 111.51%,显著增强了 Agent 的工具获取能力。

AI 推荐理由

论文核心解决工具检索问题,直接提升 Agent 在模糊指令下的工具选择与使用能力。

研究机构
Department of Gastroenterology, Renmin Hospital, Wuhan University, Wuhan, China School of Computer Science, Wuhan University, Wuhan, China State Grid Corporation, China
论文信息
作者 Kunfeng Chen, Luyao Zhuang, Fei Liao, Juhua Liu, Jian Wang et al.
发布日期 2026-04-09
arXiv ID 2604.07816
相关性评分 9/10 (高度相关)