GUI Agent Self-Distillation Grounding Reinforcement Learning
摘要

图形用户界面(GUI)定位将自然语言指令映射至目标元素的视觉坐标,是自主 GUI 智能体的核心能力。针对现有强化学习方法依赖昂贵多次 rollout 且稀疏信号问题,本文提出首个专为 GUI 定位设计的在线策略自蒸馏(OPSD)框架 GUI-SD。该方法通过构建视觉增强的特权上下文及熵引导蒸馏机制,自适应加权令牌优化。实验表明,GUI-SD 在六个基准测试中准确率与训练效率均优于现有方法。

AI 推荐理由

论文核心研究 GUI Agent 的工具使用能力(界面定位),提出新训练框架显著提升技能表现。

研究机构
Institute of Information Engineering, Chinese Academy of Sciences VCIP & TMCC & DISSec, College of Computer Science, Naikai University School of Cyber Security, University of Chinese Academy of Sciences
论文信息
作者 Yan Zhang, Daiqing Wu, Huawen Shen, Yu Zhou, Can Ma
发布日期 2026-05-01
arXiv ID 2605.00642
相关性评分 9/10 (高度相关)