摘要
本文提出一种原则性分层框架,将视觉 - 语言模型(VLM)的 3D 空间理解学习分解为从几何感知到抽象空间推理的四个渐进层级。基于该框架,我们构建了自动化流水线,处理约 500 万张图像及超 4500 万个物体,生成多样化的 3D 空间问答对用于监督微调。此外,我们开发了融入度量尺度点图的 RGB-D VLM 以增强空间理解。实验表明,该方法在多个空间理解与推理基准上达到最先进水平,超越了专用模型及 Gemini-2.5-pro 等 proprietary 系统。
AI 推荐理由
论文核心聚焦于构建分层框架以提升 VLM 的 3D 空间推理能力,直接对应推理主题。
研究机构
清华大学
Microsoft Research Asia
University of the Chinese Academy of Sciences
Xi'an Jiaotong University
论文信息