摘要
现有基准主要在理想化路径上评估工具集成推理,忽视了现实中的工具故障。本文提出 ToolMaze 基准,用于评估智能体在工具集成推理中的动态路径发现与错误恢复能力。该基准采用二维设计:基于 DAG 的拓扑复杂度和工具扰动分类(显式/隐式、瞬时/永久)。评估显示,扰动显著降低模型性能,尤其在隐式语义故障下,因过度信任受损输出,恢复率骤降约 37%。研究发现,智能体的容错能力随模型规模增长的速度远慢于基本任务执行,表明动态重规划是未被解决的关键瓶颈。
AI 推荐理由
论文核心研究工具失败场景下的动态重规划与异常恢复机制,直接对应规划能力。
研究机构
Shanghai AI Laboratory
East China Normal University
Shandong University
Baidu Inc.
论文信息