摘要
针对通用电脑使用智能体因缺乏连续高质量人类演示视频而发展受阻的问题,本文推出 CUA-Suite。该套件包含 VideoCUA 核心数据集,提供约 1 万项跨 87 种应用的人类专家任务演示,含连续帧率屏幕录制及多层推理标注。相比稀疏截图,连续视频保留了交互的完整时序动态。此外,套件还包含用于评估定位与规划能力的 UI-Vision 基准及 GroundCUA 定位数据集。初步评估显示现有模型在专业应用中失败率较高,该多模态语料库将支持屏幕解析、空间控制等新兴研究方向。
AI 推荐理由
论文提供大规模视频演示数据集,旨在解决智能体学习电脑操作技能的数据瓶颈,核心聚焦技能习得。
研究机构
ServiceNow
渥太华大学
蒙特利尔大学
麦克吉尔大学
牛津大学
新加坡国立大学
论文信息