摘要
图形用户界面(GUI)定位将自然语言指令映射至目标元素的视觉坐标,是自主 GUI 智能体的核心能力。针对现有强化学习方法依赖昂贵多次 rollout 且稀疏信号问题,本文提出首个专为 GUI 定位设计的在线策略自蒸馏(OPSD)框架 GUI-SD。该方法通过构建视觉增强的特权上下文及熵引导蒸馏机制,自适应加权令牌优化。实验表明,GUI-SD 在六个基准测试中准确率与训练效率均优于现有方法。
AI 推荐理由
论文核心研究 GUI Agent 的工具使用能力(界面定位),提出新训练框架显著提升技能表现。
研究机构
Institute of Information Engineering, Chinese Academy of Sciences
VCIP & TMCC & DISSec, College of Computer Science, Naikai University
School of Cyber Security, University of Chinese Academy of Sciences
论文信息