摘要
针对原生视觉语言模型在通用 GUI 任务中难以解决验证码的挑战,本文提出 ReCAP 智能体。该研究构建了涵盖七类验证码的动态系统,并开发了自动化流水线,生成大规模配对推理轨迹的交互数据。特别地,利用失败轨迹构建自纠正数据,训练智能体在线反思错误并修正动作。实验表明,ReCAP 将验证码解决成功率从 30% 提升至 80%,同时保持了优异的通用 GUI 任务性能。
AI 推荐理由
论文核心在于自动化生成推理轨迹及利用失败案例进行自我纠正训练,显著提升推理能力。
研究机构
中国科学院自动化研究所
论文信息