摘要
本文提出 Demo2Tutorial 框架,旨在将屏幕录制和交互日志中捕获的人类数字环境经验,转化为结构化的多模态软件教程。该框架通过多模态动作解析器重建感知、动作与意图,利用步骤规划器将其抽象为表示目标与步骤的分层任务图,最终生成可复用的图文指令。实验表明,该方法生成的教程质量超越人工编写,不仅能加速人类学习,还能显著提升下游 GUI Agent 的任务规划与泛化性能,证明了基于人类经验提炼的结构化教程是增强 Agent 能力的有效知识表示。
AI 推荐理由
论文核心在于将人类经验转化为分层任务图,直接提升 GUI Agent 的规划与泛化能力。
研究机构
新加坡国立大学
论文信息