摘要
针对多模态大语言模型驱动的 GUI 代理因缺乏大规模多样化数据而泛化受限的问题,本文提出 Video2GUI 框架。该框架能从未标记的网络视频中自动提取落地的 GUI 交互轨迹,通过由粗到细的过滤策略识别高质量教程并转化为结构化数据。基于此构建了包含 1200 万条轨迹、覆盖 1500 多个应用的 WildGUI 数据集。实验表明,在该数据集上预训练的模型在多项基准测试中性能提升 5%-20%,达到或超越最先进水平。
AI 推荐理由
论文核心在于构建数据集以预训练 GUI Agent 的工具使用与交互技能,直接提升其操作能力。
研究机构
National Key Laboratory for Multimodal Information Processing, School of Computer Science, Peking University
论文信息