摘要
基于视觉语言模型的自主 GUI 代理常假设环境响应是确定性的,导致在真实场景中因未检测到的动作失败而产生错误累积。本文提出 VeriGUI,一种显式建模动作结果与恢复机制的代理。该方法引入“思考 - 验证 - 行动 - 预期”(TVAE)框架以检测失败并引导纠正性推理,并结合包含合成失败轨迹的鲁棒监督微调与非对称验证奖励的 GRPO 进行两阶段训练。实验表明,VeriGUI 显著减少了失败循环,提升了恢复成功率,同时保持了具有竞争力的标准任务性能。
AI 推荐理由
论文提出 TVAE 框架,核心在于通过验证引导的纠正性推理来应对环境噪声,显著提升鲁棒性。
研究机构
北京工业大学
百度公司
论文信息