Reinforcement Learning GUI Agents Self-Evolution Reward Modeling Multi-Agent System
摘要

强化学习有望提升图形用户界面(GUI)智能体在随机环境中的鲁棒性,但其训练高度依赖奖励函数质量。现有方法难以兼顾可扩展性与性能。为此,本文提出 OS-Themis,一种可扩展且准确的多智能体批评框架。该框架将轨迹分解为可验证的里程碑以隔离关键证据,并引入审查机制严格审计证据链。此外,文章推出了 OmniGUIRewardBench 基准。实验表明,OS-Themis 在支持在线强化学习训练时提升了 10.3%,在自训练循环中进行轨迹验证与过滤时提升了 6.9%,显著推动了智能体的自我进化。

AI 推荐理由

论文提出批评框架以优化奖励函数,直接驱动 Agent 的在线 RL 训练与自我进化循环。

研究机构
中国科学技术大学
论文信息
作者 Zehao Li, Zhenyu Wu, Yibo Zhao, Bowen Yang, Jingjing Xie et al.
发布日期 2026-03-19
arXiv ID 2603.19191
相关性评分 9/10 (高度相关)