GUI Agent Reinforcement Learning Knowledge Distillation Task Planning
摘要

针对轻量级端侧视觉语言 GUI 智能体受限于模型容量的问题,本文提出一种无需监督微调的新范式。通过引导式在线策略蒸馏整合广义知识,结合动态检索减少幻觉;进一步引入多解双层 GRPO 框架,协同对齐宏观子任务规划与微观执行匹配,增强长程场景探索。实验表明,该方法在轻量模型中达到最先进水平,充分释放了小规模智能体的潜力。

AI 推荐理由

论文提出双层 GRPO 框架,核心在于对齐宏观子任务规划与微观执行,显著提升长程任务规划能力。

研究机构
Moore Threads AI
论文信息
作者 Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen et al.
发布日期 2026-05-08
arXiv ID 2605.07505
相关性评分 8/10 (高度相关)