Tool Selection Retrieval Optimization Reinforcement Learning LLM Agents
摘要

在 LLM 智能体使用工具前,检索系统需决定展示哪些候选工具及其数量。现有系统多采用固定短列表大小,缺乏评估标准。本文提出将展示工具数量作为评估对象,应用“超越随机比特数”(BoR)这一机会校正指标,衡量特定深度下的成功率是否优于随机选择。研究进一步将该原理转化为强化学习奖励,以动态选择每个查询的工具列表深度。实验表明,自适应策略在大幅减少平均展示工具数的同时,显著提升了困难查询下的工具覆盖率及下游模型的选择准确率。

AI 推荐理由

论文核心研究 Agent 工具选择中的候选集大小优化,直接决定技能调用效率。

研究机构
Meta Platforms
论文信息
作者 Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell
发布日期 2026-05-23
arXiv ID 2605.24660
相关性评分 9/10 (高度相关)