GUI Agent Self-Correction Robustness VLM
摘要

基于视觉语言模型的自主 GUI 代理常假设环境响应是确定性的,导致在真实场景中因未检测到的动作失败而产生错误累积。本文提出 VeriGUI,一种显式建模动作结果与恢复机制的代理。该方法引入“思考 - 验证 - 行动 - 预期”(TVAE)框架以检测失败并引导纠正性推理,并结合包含合成失败轨迹的鲁棒监督微调与非对称验证奖励的 GRPO 进行两阶段训练。实验表明,VeriGUI 显著减少了失败循环,提升了恢复成功率,同时保持了具有竞争力的标准任务性能。

AI 推荐理由

论文提出 TVAE 框架,核心在于通过验证引导的纠正性推理来应对环境噪声,显著提升鲁棒性。

研究机构
北京工业大学 百度公司
论文信息
作者 Yuzhe Zhang, Xianwei Xue, Xingyong Wu, Mengke Chen, Chen Liu et al.
发布日期 2026-04-07
arXiv ID 2604.05477
相关性评分 9/10 (高度相关)