Spatial Reasoning 3D Scene Graph Agent Framework Geometric Grounding
摘要

视觉语言模型在室内场景理解中表现优异,但在度量与空间推理方面仍存不足。现有方法多依赖端到端视频理解或大规模微调,导致感知与推理耦合。本文提出一种代理框架,将大语言模型 grounded 于显式 3D 场景图(3DSG)中,通过专用感知模块构建持久化场景表示。智能体仅通过结构化几何工具交互,获取物体尺寸、距离及空间关系等属性。实验表明,在理想感知条件下,该方法的空间推理性能上限显著优于前人工作(最高提升 16%),且无需特定任务微调。相比基础 VLM,该代理变体平均性能提升 33% 至 50%,证明显式几何 grounding 能大幅增强空间推理能力。

AI 推荐理由

论文核心研究解耦感知与推理,利用显式几何 grounding 显著提升空间推理能力。

研究机构
Riemann Lab, Huawei Technologies
论文信息
作者 Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz et al.
发布日期 2026-03-16
arXiv ID 2603.15386
相关性评分 9/10 (高度相关)