Mental Navigation Spatial Planning Cognitive Maps MLLM Embodied AI
摘要

尽管多模态大语言模型(MLLMs)在具身智能体中广泛应用,但其空间推理能力仍局限于即时观察的反应式规划。受生物智能“心理导航”启发,本文提出 Video2Mental 基准,评估 MLLMs 从长视频中构建分层认知地图并生成基于地标的路径计划的能力。针对现有模型表现不佳的问题,作者提出 NavMind 推理模型,利用显式细粒度认知地图作为可学习的中间表示,并通过难度分层的渐进式监督微调,显著提升了长程空间规划精度,优于前沿商业及空间专用模型。

AI 推荐理由

论文核心研究基于心理导航的任务规划,提出构建认知地图并生成路径计划的方法。

研究机构
清华大学人工智能研究院 清华大学计算机科学与技术系 清华大学-伯克利Joint ML Center, THBI Lab, BNRist Center 清华大学自动化系
论文信息
作者 Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang et al.
发布日期 2026-03-23
arXiv ID 2603.21577
相关性评分 9/10 (高度相关)