GUI Agent Test-Time Scaling Contrastive Learning Action Ranking
摘要

测试时扩展(TTS)通过采样候选动作并利用批判模型排序,成为通用 GUI 智能体的重要范式。然而,现有批判模型采用二元分类,导致有效动作与干扰项分数混淆。本文指出其存在“功能坍缩”和“噪声敏感”缺陷,提出 BBCritic 方法,基于功能等价假设,通过两阶段对比学习在共享功能空间对齐指令与动作,恢复层级结构。同时构建 BBBench 基准,支持细粒度排序评估。实验表明,BBCritic-3B 在无额外标注下优于 7B 参数 SOTA 模型,具备强零-shot 迁移能力。

AI 推荐理由

论文核心解决 GUI Agent 测试时扩展中的动作排序与规划选择问题,提升多步任务执行准确性。

研究机构
Shanghai Jiao Tong University Xiaomi Inc.
论文信息
作者 Yuchen Sun, Pei Fu, Shaojie Zhang, Anan Du, Xiuwen Xi et al.
发布日期 2026-05-14
arXiv ID 2605.14311
相关性评分 8/10 (高度相关)