Computer-Use Agents RLVR Data Synthesis Skill Learning
摘要

针对计算机使用代理(CUA)缺乏可扩展且具确定性奖励的训练数据这一瓶颈,本文提出 CUA-Gym。该框架通过生成器、判别器与协调器代理协同工作,自动生成任务指令、环境状态及奖励函数,并合成包含 110 个高保真模拟 Web 应用的 CUA-Gym-Hub。基于此构建的 3 万余条验证数据集训练出的模型,在 OSWorld-Verified 和 WebArena 基准上显著优于现有开源模型,证明了其在提升代理技能方面的有效性与泛化能力。

AI 推荐理由

论文核心构建计算机使用代理的训练环境与数据,直接提升其工具使用与操作技能。

研究机构
The University of Hong Kong Qwen Team, Alibaba Inc. University of California, San Diego Binghua University
论文信息
作者 Bowen Wang, Dunjie Lu, Junli Wang, Tianyi Bai, Shixuan Liu et al.
发布日期 2026-05-25
arXiv ID 2605.25624
相关性评分 9/10 (高度相关)