摘要
尽管多模态大语言模型在构建图形用户界面(GUI)智能体方面进展迅速,但因缺乏 GUI 操作的世界知识,其实际任务完成能力受限。现有方法依赖昂贵的多智能体架构或后训练范式,导致低效的记忆而非真正理解。为此,本文提出 GUI-CIDER,一种通过因果内化和密度感知样本重选显式学习 GUI 世界知识的中期训练方法。该方法包含数据合成、样本重选及中期训练三个阶段,旨在将静态规划与动态因果知识嵌入模型。实验表明,该方法显著提升了智能体对 GUI 操作的理解及任务成功率。
AI 推荐理由
论文核心在于通过中期训练显式内化 GUI 规划知识,解决任务规划瓶颈。
研究机构
School of Computer Science, Shanghai Jiao Tong University
Zhejiang University
Meituan
The Chinese University of Hong Kong
论文信息