Spatial Reasoning Theory of Mind Embodied AI Multi-Modal LLM
摘要

多模态大语言模型(MLLMs)虽具备通用推理能力,但其具身空间智能受限于“笛卡尔幻觉”,缺乏落地的 3D 拓扑理解。本文针对多智能体环境中所需的二阶心智理论(ToM),提出一种新颖的视听任务:要求智能体 A 基于智能体 B 的物理朝向和感官局限,推断 B 对 A 相对位置的估计。为此,我们设计了“认知感知瓶颈”模块,并引入基于锚点的具身空间分解思维链(CoT)。该方法引导模型进行“几何到语义”的投影,动态加权视觉与听觉模态。实验表明,该方法显著优于现有基线,揭示了 MLLMs 的空间推理极限并确立了具身 AI 中认知感知推理的新范式。

AI 推荐理由

论文核心提出基于感知的推理链,解决多模态模型在具身心智理论中的空间推理瓶颈。

研究机构
College of Computer Science, Beijing Information Science and Technology University
论文信息
作者 Yajing Zhou, Xiangyu Kong
发布日期 2026-05-18
arXiv ID 2605.18194
相关性评分 9/10 (高度相关)