Benchmark Tool Use Agent Evaluation Reproducibility
摘要

针对闭环工具使用智能体在可执行环境中的评估常混淆工作负载与证据的问题,本文提出一套可执行基准测试套件。该套件通过统一契约明确界定工作负载、驱动生成器及准入证据,整合了 WebArena Verified、SWE-Gym 及 MiniWoB++ 等环境。其核心创新在于建立严格的证据准入机制,区分论文级证据与诊断数据,记录延迟、无效行为及验证元数据。研究表明,该机制能显著影响控制器变体的选择决策,为工具使用能力的评估提供了标准化、可审计的框架。

AI 推荐理由

论文核心在于构建评估工具使用 Agent 的可执行基准套件,直接关联技能学习与工具调用评估。

研究机构
Stevens Institute of Technology
论文信息
作者 Zhiqing Zhong, Zhijing Ye, Jiamin Wang, Xiaodong Yu
发布日期 2026-05-10
arXiv ID 2605.11030
相关性评分 9/10 (高度相关)