Tool Use Benchmark Agent Evaluation MCP
摘要

当前 LLM Agent 擅长调用独立 API,但在处理商业软件自动化的“最后一公里”时表现不佳,难以应对工具间的相互依赖与环境噪声。本文提出 ComplexMCP 基准,基于模型上下文协议(MCP)构建,包含源自七个有状态沙盒的三百余个工具。该基准采用种子驱动架构模拟动态环境与 API 故障。评估显示顶尖模型成功率不足 60%,远低于人类。分析揭示了工具检索饱和、过度自信及战略性失败主义三大瓶颈,强调现有 Agent 在处理复杂工作流时的不足。

AI 推荐理由

论文核心评估 Agent 在复杂依赖环境下的工具调用与选择能力,直接对应技能学习主题。

研究机构
1 2,3 3
论文信息
作者 Yuanyang Li, Xue Yang, Longyue Wang, Weihua Luo, Hongyang Chen
发布日期 2026-05-11
arXiv ID 2605.10787
相关性评分 9/10 (高度相关)