摘要
现有软件自动化基准测试鲜少结合跨应用协调、自主 API 发现与策略遵循。针对真实业务工作流对这三者的需求,本文提出 AutomationBench,旨在通过 REST API 评估 AI 代理的跨应用工作流编排能力。该基准基于 Zapier 平台的真实模式,涵盖销售、市场等多个领域,要求代理自主发现端点、遵循复杂业务规则并在干扰环境中导航。评估仅依据最终状态的程序化评分。目前最先进模型得分不足 10%,该基准为衡量当前模型与实际业务需求的差距提供了严峻且真实的标尺。
AI 推荐理由
论文核心评估 Agent 自主发现 API、跨应用协调及遵循策略的技能,属技能学习范畴。
研究机构
daniel.shepard@zapier.com
robin.salimans@zapier.com
论文信息