摘要
随着基于大语言模型的智能体日益依赖外部工具,评估其在熟悉工作流之外维持工具落地推理的能力至关重要。本文提出 AgentEscapeBench,一种密室逃脱风格的基准测试,旨在检验智能体在显式长程依赖约束下推断、执行及修订新颖工具使用流程的能力。任务定义为工具与物品的有向无环依赖图,要求调用真实外部函数、追踪逐步揭示的隐藏状态并传播中间结果。实验表明,随依赖深度增加,性能显著下降,主要归因于长程状态追踪、线索遵循及中间结果传播的失效。该基准为诊断当前能力及指导未来通用推理训练提供了重要测试床。
AI 推荐理由
论文核心评估智能体在长程依赖下的工具落地推理能力,聚焦推理机制。
研究机构
复旦大学
Meituan Longcat Team
论文信息