摘要
多模态大模型(MLLM)难以从多视角图像中实现精确的空间理解,因其视觉表征缺乏明确的几何基础。现有方法虽引入几何线索,但仍需模型隐式推断 3D 结构,限制了空间推理能力。为此,本文提出 Cog3DMap 框架,通过递归构建显式 3D 记忆,使每个令牌兼具语义与几何信息并锚定于 3D 空间。该框架允许 MLLM 直接在空间结构化的 3D 地图上进行推理,在多项空间推理基准测试中取得了最先进性能。
AI 推荐理由
论文核心在于构建显式 3D 记忆以增强多模态大模型的空间推理能力,直接解决推理瓶颈。
研究机构
POSTECH
KAIST
RLWRLD
论文信息