摘要
视觉 - 语言 - 动作(VLA)模型依赖当前观测预测动作。现有引入显式推理的方法常受限于对思维链标注及视觉定位数据的依赖,导致数据构建耗时且推理效率降低。为此,本文提出 ATA,一种无需训练的框架,通过互补的注意力引导和动作引导策略将隐式推理引入 VLA 推理过程。该方法结合注意力图与基于动作的兴趣区域,自适应优化视觉输入,无需额外训练或标注。实验表明,ATA 在保持甚至提升推理效率的同时,显著提高了任务成功率与鲁棒性。
AI 推荐理由
论文核心提出隐式推理框架,通过注意力与动作引导提升 VLA 模型推理能力,无需额外训练。
研究机构
中国
论文信息