摘要
现有大语言模型智能体的工具使用基准测试多为线性结构,缺乏复杂性。本文提出“惊人的智能体竞赛”(AAR)基准,包含具有分叉 - 合并结构的有向无环图(DAG)谜题。该基准涵盖 1400 个实例,要求智能体导航维基百科、执行多步工具链并聚合结果。评估显示,最佳智能体准确率仅 37.2%,主要失败原因在于导航错误而非工具调用错误。研究表明,现有线性基准掩盖了智能体在复杂路径规划上的缺陷,且架构设计与模型规模同等重要。
AI 推荐理由
论文核心研究智能体在复杂有向无环图(DAG)结构中的任务导航与多步路径规划能力。
研究机构
University of Minnesota Twin Cities
Yonsei University
Google Deepmind
论文信息