摘要
测试时扩展(TTS)通过采样候选动作并利用批判模型排序,成为通用 GUI 智能体的重要范式。然而,现有批判模型采用二元分类,导致有效动作与干扰项分数混淆。本文指出其存在“功能坍缩”和“噪声敏感”缺陷,提出 BBCritic 方法,基于功能等价假设,通过两阶段对比学习在共享功能空间对齐指令与动作,恢复层级结构。同时构建 BBBench 基准,支持细粒度排序评估。实验表明,BBCritic-3B 在无额外标注下优于 7B 参数 SOTA 模型,具备强零-shot 迁移能力。
AI 推荐理由
论文核心解决 GUI Agent 测试时扩展中的动作排序与规划选择问题,提升多步任务执行准确性。
研究机构
Shanghai Jiao Tong University
Xiaomi Inc.
论文信息