摘要
视觉语言模型在室内场景理解中表现优异,但在度量与空间推理方面仍存不足。现有方法多依赖端到端视频理解或大规模微调,导致感知与推理耦合。本文提出一种代理框架,将大语言模型 grounded 于显式 3D 场景图(3DSG)中,通过专用感知模块构建持久化场景表示。智能体仅通过结构化几何工具交互,获取物体尺寸、距离及空间关系等属性。实验表明,在理想感知条件下,该方法的空间推理性能上限显著优于前人工作(最高提升 16%),且无需特定任务微调。相比基础 VLM,该代理变体平均性能提升 33% 至 50%,证明显式几何 grounding 能大幅增强空间推理能力。
AI 推荐理由
论文核心研究解耦感知与推理,利用显式几何 grounding 显著提升空间推理能力。
研究机构
Riemann Lab, Huawei Technologies
论文信息