spatial reasoning world models multilingual evaluation cognitive constraints
摘要

本文探讨大语言模型(LLM)是否能从纯文本描述中构建内部空间世界模型及其跨语言迁移能力。作者提出 MentalMap 多语言诊断基准,涵盖六个能力层级及四个诊断维度,基于 100 个场景和八种语言进行评估。研究发现所有模型在视角推理上存在普遍的 L3 级“推理悬崖”,且该现象与人类在相同协议下的表现一致,表明瓶颈源于纯文本工作记忆限制。研究将纯文本空间推理重构为多维世界建模问题,并建议未来探索多模态及草稿增强型推理方向。

AI 推荐理由

论文核心研究 LLM 基于纯文本的空间推理能力及世界模型构建,直接评估推理机制瓶颈。

研究机构
University of New South Wales Essential Energy University of Alabama at Birmingham Tsinghua University Zhejiang University Fudan University
论文信息
作者 Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao et al.
发布日期 2026-05-27
arXiv ID 2605.28277
相关性评分 9/10 (高度相关)