摘要
本文提出一种 3D 思维引导的共训练框架,使视觉 - 语言 - 动作(VLA)模型能在动作预测中隐式执行 3D 空间推理。核心洞察是将 3D 几何感知与空间推理解耦并注入不同特征层级。该方法包含三个组件:潜在 3D 几何感知模块对齐视觉特征以获取几何先验;在线 3D 推理蒸馏模块通过共享锚点 token 消除提示诱导的推理差距;空间增强动作集成模块将两者联合注入动作查询 token。部署时仅保留轻量适配器,无需 3D 传感器或显式文本生成,即在多个基准测试中达到最先进水平。
AI 推荐理由
论文核心在于通过隐式 3D 思维引导共训练,赋予模型 3D 空间推理能力,解决几何感知与推理分离问题。
研究机构
上海交通大学
哈尔滨工业大学
南京大学
南洋理工大学
达曼机器人
大疆创新
论文信息