Computer-Use Agents Reward Modeling Action Evaluation GUI Automation
摘要

计算机使用代理(CUA)常因缺乏动作质量评估而产生不可逆错误。本文提出 IntentScore,一种感知规划的奖励模型,通过在动作编码器中嵌入规划意图,区分相似动作背后的不同逻辑。该模型在跨操作系统的 39.8 万步离线数据上训练,采用对比对齐和边际排序双重目标。实验表明,其在未见过的环境和代理上显著提升了任务成功率,证明了离线轨迹学习的泛化能力。

AI 推荐理由

论文提出基于规划意图的动作评估模型,直接优化 Agent 的任务执行与计划质量。

研究机构
George Washington University, Washington D.C., USA
论文信息
作者 Rongqian Chen, Yu Li, Zeyu Fang, Sizhe Tang, Weidong Cao et al.
发布日期 2026-04-06
arXiv ID 2604.05157
相关性评分 9/10 (高度相关)