摘要
计算机使用智能体(CUA)正将大语言模型的能力从文本推理扩展至浏览器和图形界面等复杂环境。然而,现有基准多基于简化设定,难以评估真实专业工作流中的表现。本文提出 SaaS-Bench,涵盖六个领域的 23 个可部署 SaaS 系统及 106 项现实任务,重点考察长程执行与跨应用协调。实验表明,即使是最强模型端到端完成率也不足 4%,暴露出其在任务规划、状态追踪及错误恢复方面的显著缺陷。
AI 推荐理由
论文核心评估 Agent 在长程、跨应用工作流中的规划与状态追踪能力,明确指出当前模型在规划方面的局限。
研究机构
UniPat AI
PKU
HKU
论文信息