Tool Use Benchmark Error Recovery Agent Evaluation
摘要

即使语言理解能力强,智能体常因操作原因(如参数无效、接口漂移、恢复能力弱及重试低效)导致工具使用失败。本文提出 ToolMisuseBench,这是一个离线确定性基准,旨在明确步数、调用及重试预算下评估工具误用与恢复能力。该基准涵盖 CRUD、检索、文件及调度环境,支持可重放的故障注入,并报告成功率、无效调用行为、策略违规、恢复质量及预算效率。我们发布了包含 6800 个任务的公共数据集及可复现评估流程。基线结果显示,感知模式的方法在特定故障恢复上有所增益,但在严格授权与硬失败设置下整体成功率仍有限。

AI 推荐理由

论文核心研究 Agent 工具使用中的错误处理与恢复机制,直接关联技能学习。

研究机构
Independent Researcher
论文信息
作者 Akshey Sigdel, Rista Baral
发布日期 2026-04-02
arXiv ID 2604.01508
相关性评分 9/10 (高度相关)