摘要
视觉 - 语言 - 动作(VLA)模型虽能将多模态观测转化为机器人动作,但常忽略显式推理步骤,导致复杂长程任务中可解释性与泛化性不足。本文提出 ReFineVLA 框架,利用专家教师模型生成推理依据增强数据集,指导 VLA 学习动作背后的逻辑。通过在推理增强数据上微调预训练模型,该方法在保持泛化能力的同时显著提升了推理水平。注意力可视化证实了模型在视觉、语言与动作域间的有效对齐。在 SimplerEnv 基准测试中,ReFineVLA 取得了最先进的成功率。
AI 推荐理由
论文核心提出多模态推理感知框架,通过教师引导微调显式增强模型逻辑推理能力。
研究机构
University of Texas at Arlington, Texas, USA
VinRobotics, Hanoi, Vietnam
论文信息