摘要
计算机使用代理(CUA)常因缺乏动作质量评估而产生不可逆错误。本文提出 IntentScore,一种感知规划的奖励模型,通过在动作编码器中嵌入规划意图,区分相似动作背后的不同逻辑。该模型在跨操作系统的 39.8 万步离线数据上训练,采用对比对齐和边际排序双重目标。实验表明,其在未见过的环境和代理上显著提升了任务成功率,证明了离线轨迹学习的泛化能力。
AI 推荐理由
论文提出基于规划意图的动作评估模型,直接优化 Agent 的任务执行与计划质量。
研究机构
George Washington University, Washington D.C., USA
论文信息