摘要
在 LLM 智能体使用工具前,检索系统需决定展示哪些候选工具及其数量。现有系统多采用固定短列表大小,缺乏评估标准。本文提出将展示工具数量作为评估对象,应用“超越随机比特数”(BoR)这一机会校正指标,衡量特定深度下的成功率是否优于随机选择。研究进一步将该原理转化为强化学习奖励,以动态选择每个查询的工具列表深度。实验表明,自适应策略在大幅减少平均展示工具数的同时,显著提升了困难查询下的工具覆盖率及下游模型的选择准确率。
AI 推荐理由
论文核心研究 Agent 工具选择中的候选集大小优化,直接决定技能调用效率。
研究机构
Meta Platforms
论文信息