摘要
针对计算机使用代理(CUA)缺乏可扩展且具确定性奖励的训练数据这一瓶颈,本文提出 CUA-Gym。该框架通过生成器、判别器与协调器代理协同工作,自动生成任务指令、环境状态及奖励函数,并合成包含 110 个高保真模拟 Web 应用的 CUA-Gym-Hub。基于此构建的 3 万余条验证数据集训练出的模型,在 OSWorld-Verified 和 WebArena 基准上显著优于现有开源模型,证明了其在提升代理技能方面的有效性与泛化能力。
AI 推荐理由
论文核心构建计算机使用代理的训练环境与数据,直接提升其工具使用与操作技能。
研究机构
The University of Hong Kong
Qwen Team, Alibaba Inc.
University of California, San Diego
Binghua University
论文信息