3D 空间推理 VLA 模型 隐式推理 共训练框架 机器人操作
摘要

本文提出一种 3D 思维引导的共训练框架,使视觉 - 语言 - 动作(VLA)模型能在动作预测中隐式执行 3D 空间推理。核心洞察是将 3D 几何感知与空间推理解耦并注入不同特征层级。该方法包含三个组件:潜在 3D 几何感知模块对齐视觉特征以获取几何先验;在线 3D 推理蒸馏模块通过共享锚点 token 消除提示诱导的推理差距;空间增强动作集成模块将两者联合注入动作查询 token。部署时仅保留轻量适配器,无需 3D 传感器或显式文本生成,即在多个基准测试中达到最先进水平。

AI 推荐理由

论文核心在于通过隐式 3D 思维引导共训练,赋予模型 3D 空间推理能力,解决几何感知与推理分离问题。

研究机构
上海交通大学 哈尔滨工业大学 南京大学 南洋理工大学 达曼机器人 大疆创新
论文信息
作者 Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu et al.
发布日期 2026-06-03
arXiv ID 2606.04436
相关性评分 9/10 (高度相关)