摘要
基础模型虽表现优异,但其构建内部空间世界模型以支持推理和规划的能力尚不明确。本文通过需多步规划与空间抽象的迷宫任务,系统评估了多种大语言模型的空间理解力。实验发现,模型表现高度依赖表示形式:文本邻接表示下准确率较高,而视觉网格格式下性能显著崩溃。尽管推理轨迹语义覆盖率高,模型却未能利用此理解进行一致的空间计算,表明其未建立累积的空间知识。研究结论指出,LLM 并未形成鲁棒的空间世界模型,仅在特定条件下表现出依赖提示和表示的推理能力。
AI 推荐理由
论文核心评估 LLM 在迷宫任务中的多步规划与空间建模能力,直接针对规划机制。
研究机构
University of Notre Dame
Columbia University
MQube Cognition
论文信息