摘要
本文探讨大语言模型(LLM)是否能从纯文本描述中构建内部空间世界模型及其跨语言迁移能力。作者提出 MentalMap 多语言诊断基准,涵盖六个能力层级及四个诊断维度,基于 100 个场景和八种语言进行评估。研究发现所有模型在视角推理上存在普遍的 L3 级“推理悬崖”,且该现象与人类在相同协议下的表现一致,表明瓶颈源于纯文本工作记忆限制。研究将纯文本空间推理重构为多维世界建模问题,并建议未来探索多模态及草稿增强型推理方向。
AI 推荐理由
论文核心研究 LLM 基于纯文本的空间推理能力及世界模型构建,直接评估推理机制瓶颈。
研究机构
University of New South Wales
Essential Energy
University of Alabama at Birmingham
Tsinghua University
Zhejiang University
Fudan University
论文信息