3D Spatial Reasoning Vision-Language Models Hierarchical Learning
摘要

本文提出一种原则性分层框架,将视觉 - 语言模型(VLM)的 3D 空间理解学习分解为从几何感知到抽象空间推理的四个渐进层级。基于该框架,我们构建了自动化流水线,处理约 500 万张图像及超 4500 万个物体,生成多样化的 3D 空间问答对用于监督微调。此外,我们开发了融入度量尺度点图的 RGB-D VLM 以增强空间理解。实验表明,该方法在多个空间理解与推理基准上达到最先进水平,超越了专用模型及 Gemini-2.5-pro 等 proprietary 系统。

AI 推荐理由

论文核心聚焦于构建分层框架以提升 VLM 的 3D 空间推理能力,直接对应推理主题。

研究机构
清华大学 Microsoft Research Asia University of the Chinese Academy of Sciences Xi'an Jiaotong University
论文信息
作者 Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng et al.
发布日期 2026-03-26
arXiv ID 2603.25411
相关性评分 9/10 (高度相关)