3D Reasoning Vision-Language Models Spatial Understanding Localization
摘要

多模态大语言模型在连接视觉与语言方面进展显著,但在空间理解和视角感知推理上仍显不足。现有工作多通过增加几何线索增强输入,而非显式教导模型进行 3D 推理。本文提出 Loc3R-VLM 框架,利用单目视频输入赋予 2D 视觉 - 语言模型高级 3D 理解能力。受人类空间认知启发,该框架采用全局布局重建和显式情境建模两个联合目标,提供直接的空间监督,将感知与语言锚定于 3D 语境中。结合预训练 3D 基础模型提取的轻量级相机位姿先验,确保几何一致性与度量尺度对齐。实验表明,该方法在语言定位任务中达到最先进水平,并在 3D 问答基准测试中优于现有方法。

AI 推荐理由

论文核心在于赋予模型 3D 空间推理能力,解决视角感知和空间理解难题。

研究机构
Microsoft Spatial AI Lab ETH Zurich
论文信息
作者 Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang et al.
发布日期 2026-03-18
arXiv ID 2603.18002
相关性评分 9/10 (高度相关)