摘要
针对计算机使用代理(CUA)在原子 GUI 动作与高层工具调用混合空间中的决策不确定性,本文提出 ToolCUA。该方法通过分阶段训练范式学习最优路径选择:首先利用交错轨迹扩展流水线合成多样化数据;其次结合监督微调与单步强化学习优化关键切换点决策;最后在高保真环境中通过在线代理强化学习及工具效率奖励机制进一步优化。实验表明,该方法在 OSWorld-MCP 上准确率显著提升,确立了同类模型的新标杆,证明了混合动作空间训练的有效性。
AI 推荐理由
论文核心研究 Agent 如何在 GUI 操作与工具调用间进行最优选择与编排,属于技能学习与工具使用范畴。
研究机构
Tongyi Lab, Alibaba Group
Pudan University
Shanghai Artificial Intelligence Laboratory
论文信息