VLA Robotics Teacher-Guided Fine-Tuning Multimodal Reasoning
摘要

视觉 - 语言 - 动作(VLA)模型虽能将多模态观测转化为机器人动作,但常忽略显式推理步骤,导致复杂长程任务中可解释性与泛化性不足。本文提出 ReFineVLA 框架,利用专家教师模型生成推理依据增强数据集,指导 VLA 学习动作背后的逻辑。通过在推理增强数据上微调预训练模型,该方法在保持泛化能力的同时显著提升了推理水平。注意力可视化证实了模型在视觉、语言与动作域间的有效对齐。在 SimplerEnv 基准测试中,ReFineVLA 取得了最先进的成功率。

AI 推荐理由

论文核心提出多模态推理感知框架,通过教师引导微调显式增强模型逻辑推理能力。

研究机构
University of Texas at Arlington, Texas, USA VinRobotics, Hanoi, Vietnam
论文信息
作者 Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen et al.
发布日期 2026-04-20
arXiv ID 2604.17800
相关性评分 9/10 (高度相关)