Tool Use Model Routing Benchmark Small Language Models Agentic Systems
摘要

本文提出 AgentFloor 基准,旨在探究智能体工作流中哪些部分需大模型,哪些可由小模型胜任。该基准包含 30 个任务,涵盖指令遵循、工具使用及多步协调等六层能力。评估显示,中小尺寸开源模型已足以处理大多数短时程、结构化的工具调用任务,且在综合表现上可媲美 GPT-5,同时成本更低、速度更快。然而,在需要长期规划与持续约束跟踪的任务中,前沿大模型仍具优势。研究建议采用混合架构:常规动作使用小模型,复杂规划保留给大模型。

AI 推荐理由

论文核心研究小模型在工具使用(tool use)任务上的能力边界与路由策略。

研究机构
Harvard University, Boston, MA 02115 Boston, MA 02115
论文信息
作者 Ranit Karmakar, Jayita Chatterjee
发布日期 2026-05-01
arXiv ID 2605.00334
相关性评分 9/10 (高度相关)