GUI Agent Reinforcement Learning Faithfulness Mobile Interaction
摘要

基于视觉语言模型的图形用户界面(GUI)智能体虽具备强大交互能力,但常表现出不忠实行为,依赖记忆捷径而非屏幕证据或用户指令。为此,本文提出 Faithful-Agent 框架,优先确保证据落地与内部一致性。该方法采用两阶段流程:首先通过面向忠实性的监督微调培养在证据扰动下的克制行为;随后利用基于 GRPO 的引导优势估计器(GuAE)进行强化微调,防止稀疏奖励下的优势坍塌。实验显示,该方法将陷阱场景成功率从 13.88% 提升至 80.21%,同时保持了稳健的指令遵循能力。

AI 推荐理由

论文核心解决 GUI Agent 工具使用中的不忠实问题,提出新框架提升交互技能。

研究机构
清华大学
论文信息
作者 Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu et al.
发布日期 2026-05-02
arXiv ID 2605.01208
相关性评分 9/10 (高度相关)