摘要
当前 LLM Agent 擅长调用独立 API,但在处理商业软件自动化的“最后一公里”时表现不佳,难以应对工具间的相互依赖与环境噪声。本文提出 ComplexMCP 基准,基于模型上下文协议(MCP)构建,包含源自七个有状态沙盒的三百余个工具。该基准采用种子驱动架构模拟动态环境与 API 故障。评估显示顶尖模型成功率不足 60%,远低于人类。分析揭示了工具检索饱和、过度自信及战略性失败主义三大瓶颈,强调现有 Agent 在处理复杂工作流时的不足。
AI 推荐理由
论文核心评估 Agent 在复杂依赖环境下的工具调用与选择能力,直接对应技能学习主题。
研究机构
1
2,3
3
论文信息