Computer-Use Agents Video Demonstrations Skill Learning Dataset
摘要

针对通用电脑使用智能体因缺乏连续高质量人类演示视频而发展受阻的问题,本文推出 CUA-Suite。该套件包含 VideoCUA 核心数据集,提供约 1 万项跨 87 种应用的人类专家任务演示,含连续帧率屏幕录制及多层推理标注。相比稀疏截图,连续视频保留了交互的完整时序动态。此外,套件还包含用于评估定位与规划能力的 UI-Vision 基准及 GroundCUA 定位数据集。初步评估显示现有模型在专业应用中失败率较高,该多模态语料库将支持屏幕解析、空间控制等新兴研究方向。

AI 推荐理由

论文提供大规模视频演示数据集,旨在解决智能体学习电脑操作技能的数据瓶颈,核心聚焦技能习得。

研究机构
ServiceNow 渥太华大学 蒙特利尔大学 麦克吉尔大学 牛津大学 新加坡国立大学
论文信息
作者 Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li et al.
发布日期 2026-03-25
arXiv ID 2603.24440
相关性评分 9/10 (高度相关)