Spatial Memory Embodied AI Benchmark Belief Revision
摘要

多模态大语言模型在静态视觉空间推理上虽有进展,但在具身场景中常难以维持长程空间一致性。本文提出 SpaMEM 基准,通过动作驱动的场景变换隔离空间信念演化机制。该基准包含千万级高保真图像,构建了从原子感知到端到端信念维护的三层诊断体系。评估显示,模型在依赖文本记录时表现尚可,但缺乏鲁棒的视觉记忆能力,揭示了其在符号支撑上的依赖性,强调了显式状态表示与长程情景整合机制的必要性。

AI 推荐理由

论文核心研究具身环境下的空间记忆机制、信念更新及长程情景整合,直接针对记忆架构。

研究机构
UNSW Sydney University of Alabama Fudan University Tsinghua University Zhejiang University Xinjiang University HKUST(GZ)
论文信息
作者 Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao et al.
发布日期 2026-04-24
arXiv ID 2604.22409
相关性评分 9/10 (高度相关)