GUI Agent Cross-Application Benchmark Task Planning
摘要

现有 GUI 代理基准多关注孤立单应用任务,忽视了协调多应用完成专业工作流的关键需求。为此,本文提出 WindowsWorld 基准,旨在系统评估代理在模拟真实专业活动的复杂多步任务中的表现。该基准利用多代理框架生成涵盖 17 种常见桌面应用的 181 个任务,其中 78% 本质上涉及多应用协作。实验表明,当前领先模型在多应用任务中成功率极低(<21%),尤其在涉及跨三个及以上应用的条件判断与推理时往往停滞于早期子目标,且执行效率低下。

AI 推荐理由

论文聚焦跨应用复杂工作流中的多步任务规划与子目标分解,评估代理在长程规划中的表现。

研究机构
Harbin Institute of Technology Shenzhen Loop Area Institute
论文信息
作者 Jinchao Li, Yunxin Li, Chenrui Zhao, Zhenran Xu, Baotian Hu et al.
发布日期 2026-04-30
arXiv ID 2604.27776
相关性评分 9/10 (高度相关)