Benchmark Agent Planning Tool Use Navigation DAG
摘要

现有大语言模型智能体的工具使用基准测试多为线性结构,缺乏复杂性。本文提出“惊人的智能体竞赛”(AAR)基准,包含具有分叉 - 合并结构的有向无环图(DAG)谜题。该基准涵盖 1400 个实例,要求智能体导航维基百科、执行多步工具链并聚合结果。评估显示,最佳智能体准确率仅 37.2%,主要失败原因在于导航错误而非工具调用错误。研究表明,现有线性基准掩盖了智能体在复杂路径规划上的缺陷,且架构设计与模型规模同等重要。

AI 推荐理由

论文核心研究智能体在复杂有向无环图(DAG)结构中的任务导航与多步路径规划能力。

研究机构
University of Minnesota Twin Cities Yonsei University Google Deepmind
论文信息
作者 Zae Myung Kim, Dongseok Lee, Jaehyung Kim, Vipul Raheja, Dongyeop Kang
发布日期 2026-04-11
arXiv ID 2604.10261
相关性评分 9/10 (高度相关)