GUI Agent 数据合成 预训练 多模态学习
摘要

针对多模态大语言模型驱动的 GUI 代理因缺乏大规模多样化数据而泛化受限的问题,本文提出 Video2GUI 框架。该框架能从未标记的网络视频中自动提取落地的 GUI 交互轨迹,通过由粗到细的过滤策略识别高质量教程并转化为结构化数据。基于此构建了包含 1200 万条轨迹、覆盖 1500 多个应用的 WildGUI 数据集。实验表明,在该数据集上预训练的模型在多项基准测试中性能提升 5%-20%,达到或超越最先进水平。

AI 推荐理由

论文核心在于构建数据集以预训练 GUI Agent 的工具使用与交互技能,直接提升其操作能力。

研究机构
National Key Laboratory for Multimodal Information Processing, School of Computer Science, Peking University
论文信息
作者 Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li et al.
发布日期 2026-05-14
arXiv ID 2605.14747
相关性评分 9/10 (高度相关)