GUI Agent Reinforcement Learning Reasoning Data Curation
摘要

针对开源原生 GUI Agent 在长程导航任务上落后于闭源系统的问题,本文指出其根源在于缺乏高质量的动作对齐推理数据,以及通用后训练流程忽视了 GUI 代理的独特挑战。为此,作者提出了 GUI-Libra 训练方案:首先构建并过滤出 8.1 万条 GUI 推理数据集;其次提出动作感知监督微调,混合推理后行动与直接行动数据以平衡推理与落地能力;最后通过引入 KL 正则化和成功自适应缩放,解决了部分可验证性下的强化学习不稳定问题。实验表明该方法显著提升了任务完成率。

AI 推荐理由

论文核心解决 GUI Agent 中推理与落地的矛盾,提出动作感知监督及 RL 优化。

研究机构
UUC Microsoft UNC-Chapel Hill
论文信息
作者 Rui Yang, Qianhui Wu, Zhaoyang Wang, Hanyang Chen, Ke Yang et al.
发布日期 2026-02-25
arXiv ID 2602.22190
相关性评分 9/10 (高度相关)