Spatial Reasoning 3D Cognitive Map Multimodal LLM Geometric Grounding
摘要

多模态大模型(MLLM)难以从多视角图像中实现精确的空间理解,因其视觉表征缺乏明确的几何基础。现有方法虽引入几何线索,但仍需模型隐式推断 3D 结构,限制了空间推理能力。为此,本文提出 Cog3DMap 框架,通过递归构建显式 3D 记忆,使每个令牌兼具语义与几何信息并锚定于 3D 空间。该框架允许 MLLM 直接在空间结构化的 3D 地图上进行推理,在多项空间推理基准测试中取得了最先进性能。

AI 推荐理由

论文核心在于构建显式 3D 记忆以增强多模态大模型的空间推理能力,直接解决推理瓶颈。

研究机构
POSTECH KAIST RLWRLD
论文信息
作者 Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin et al.
发布日期 2026-03-24
arXiv ID 2603.23023
相关性评分 9/10 (高度相关)