Tool Use Reasoning Benchmark Long-range Dependency LLM Agents
摘要

随着基于大语言模型的智能体日益依赖外部工具,评估其在熟悉工作流之外维持工具落地推理的能力至关重要。本文提出 AgentEscapeBench,一种密室逃脱风格的基准测试,旨在检验智能体在显式长程依赖约束下推断、执行及修订新颖工具使用流程的能力。任务定义为工具与物品的有向无环依赖图,要求调用真实外部函数、追踪逐步揭示的隐藏状态并传播中间结果。实验表明,随依赖深度增加,性能显著下降,主要归因于长程状态追踪、线索遵循及中间结果传播的失效。该基准为诊断当前能力及指导未来通用推理训练提供了重要测试床。

AI 推荐理由

论文核心评估智能体在长程依赖下的工具落地推理能力,聚焦推理机制。

研究机构
复旦大学 Meituan Longcat Team
论文信息
作者 Zhengkang Guo, Yiyang Li, Lin Qiu, Xiaohua Wang, Jingwen Xv et al.
发布日期 2026-05-08
arXiv ID 2605.07926
相关性评分 9/10 (高度相关)