摘要
多模态大语言模型在静态视觉空间推理上虽有进展,但在具身场景中常难以维持长程空间一致性。本文提出 SpaMEM 基准,通过动作驱动的场景变换隔离空间信念演化机制。该基准包含千万级高保真图像,构建了从原子感知到端到端信念维护的三层诊断体系。评估显示,模型在依赖文本记录时表现尚可,但缺乏鲁棒的视觉记忆能力,揭示了其在符号支撑上的依赖性,强调了显式状态表示与长程情景整合机制的必要性。
AI 推荐理由
论文核心研究具身环境下的空间记忆机制、信念更新及长程情景整合,直接针对记忆架构。
研究机构
UNSW Sydney
University of Alabama
Fudan University
Tsinghua University
Zhejiang University
Xinjiang University
HKUST(GZ)
论文信息