GUI Agent Task Planning Multimodal Learning Human-Computer Interaction
摘要

本文提出 Demo2Tutorial 框架,旨在将屏幕录制和交互日志中捕获的人类数字环境经验,转化为结构化的多模态软件教程。该框架通过多模态动作解析器重建感知、动作与意图,利用步骤规划器将其抽象为表示目标与步骤的分层任务图,最终生成可复用的图文指令。实验表明,该方法生成的教程质量超越人工编写,不仅能加速人类学习,还能显著提升下游 GUI Agent 的任务规划与泛化性能,证明了基于人类经验提炼的结构化教程是增强 Agent 能力的有效知识表示。

AI 推荐理由

论文核心在于将人类经验转化为分层任务图,直接提升 GUI Agent 的规划与泛化能力。

研究机构
新加坡国立大学
论文信息
作者 Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao et al.
发布日期 2026-06-02
arXiv ID 2606.03951
相关性评分 9/10 (高度相关)