Computer Use Agent Evaluation Verification Framework
摘要

本文提出 OpenComputer,一个基于验证器的框架,旨在为计算机使用代理构建可验证的软件世界。该框架集成四大组件:针对特定应用的状态验证器、利用执行反馈自我进化的验证层、合成真实且机器可检查桌面任务的任务生成流水线,以及记录完整轨迹并计算可审计部分奖励的评估 harness。实验表明,其硬编码验证器比 LLM 裁判更贴合人类评判,尤其在依赖细粒度应用状态时。结果显示前沿代理在端到端完成任务上仍存困难,开源模型表现显著下降,揭示了鲁棒计算机自动化的持续差距。

AI 推荐理由

论文核心构建计算机使用代理的验证框架,聚焦工具使用与技能评估。

研究机构
University of Pennsylvania University of North Carolina at Chapel Hill
论文信息
作者 Jinbiao Wei, Qianran Ma, Yilun Zhao, Xiao Zhou, Kangqi Ni et al.
发布日期 2026-05-19
arXiv ID 2605.19769
相关性评分 9/10 (高度相关)