摘要
强化学习有望提升图形用户界面(GUI)智能体在随机环境中的鲁棒性,但其训练高度依赖奖励函数质量。现有方法难以兼顾可扩展性与性能。为此,本文提出 OS-Themis,一种可扩展且准确的多智能体批评框架。该框架将轨迹分解为可验证的里程碑以隔离关键证据,并引入审查机制严格审计证据链。此外,文章推出了 OmniGUIRewardBench 基准。实验表明,OS-Themis 在支持在线强化学习训练时提升了 10.3%,在自训练循环中进行轨迹验证与过滤时提升了 6.9%,显著推动了智能体的自我进化。
AI 推荐理由
论文提出批评框架以优化奖励函数,直接驱动 Agent 的在线 RL 训练与自我进化循环。
研究机构
中国科学技术大学
论文信息