摘要
基于大型视觉语言模型的图形用户界面(GUI)智能体在自动化数字任务中潜力巨大,但现有轨迹合成方法常导致智能体难以泛化至复杂交互。本文指出该局限源于对语义模糊动作的忽视,此类动作具有上下文依赖性或视觉歧义性。为此,提出 HATS 框架,定义“硬度”为动作的语义模糊程度,并设计硬度驱动探索与对齐引导优化两个模块。二者形成闭环,前者收集高挑战性轨迹,后者迭代修复指令与执行的对齐偏差。实验表明,该方法显著提升了智能体在基准环境中的表现。
AI 推荐理由
论文核心在于提升 GUI Agent 的工具使用与交互技能,通过合成高难度轨迹数据解决语义歧义问题。
研究机构
哈尔滨工业大学(深圳)
新加坡国立大学
论文信息