Agent Benchmark Workflow Automation Tool Use Evaluation Framework
摘要

针对现有 Agent 基准静态固化且难以验证执行过程的问题,本文提出 Claw-Eval-Live,一个面向工作流 Agent 的实时基准。该基准将可刷新的外部需求信号层与可复现的时间戳快照分离,利用公开工作流需求构建包含固定夹具、服务和评分器的受控任务。通过记录执行轨迹、审计日志及服务状态,结合确定性检查与结构化 LLM 评判进行评分。实验涵盖 105 项任务及 13 个前沿模型,结果显示工作流自动化仍具挑战,领先模型通过率仅 66.7%,揭示了人力资源及管理类多系统工作流为主要瓶颈。

AI 推荐理由

论文核心构建基于真实工作流技能的基准,评估 Agent 工具使用与任务执行能力。

研究机构
The Chinese University of Hong Kong South China University of Technology The Chinese University of Hong Kong, Shenzhen Xiamen University Peking University The Hong Kong University of Science and Technology
论文信息
作者 Chenxin Li, Zhengyang Tang, Huangxin Lin, Yunlong Lin, Shijue Huang et al.
发布日期 2026-04-30
arXiv ID 2604.28139
相关性评分 9/10 (高度相关)