GUI Agent Mid-training Causal Learning Task Planning
摘要

尽管多模态大语言模型在构建图形用户界面(GUI)智能体方面进展迅速,但因缺乏 GUI 操作的世界知识,其实际任务完成能力受限。现有方法依赖昂贵的多智能体架构或后训练范式,导致低效的记忆而非真正理解。为此,本文提出 GUI-CIDER,一种通过因果内化和密度感知样本重选显式学习 GUI 世界知识的中期训练方法。该方法包含数据合成、样本重选及中期训练三个阶段,旨在将静态规划与动态因果知识嵌入模型。实验表明,该方法显著提升了智能体对 GUI 操作的理解及任务成功率。

AI 推荐理由

论文核心在于通过中期训练显式内化 GUI 规划知识,解决任务规划瓶颈。

研究机构
School of Computer Science, Shanghai Jiao Tong University Zhejiang University Meituan The Chinese University of Hong Kong
论文信息
作者 Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen et al.
发布日期 2026-05-27
arXiv ID 2605.28534
相关性评分 9/10 (高度相关)