摘要
真正的空间推理依赖于构建和操作连贯的内部空间表征(即心理模型),而非仅处理表面语言关联。现有基准未能将这种内在空间认知与统计语言启发式分离,且多模态评估常混淆视觉感知。为此,本文提出 SpatialText,一个理论驱动的诊断框架。它结合真实 3D 室内环境的人工标注描述与代码生成的逻辑精确场景,系统评估主流模型。结果显示,尽管模型擅长检索显性事实,但在自我中心视角转换和局部参考系推理上存在关键缺陷,表明其主要依赖语言共现启发式而非构建连贯的内部表征。
AI 推荐理由
论文核心评估 LLM 的空间推理能力,诊断其是否构建内部空间表征而非依赖语言启发式。
研究机构
浙江大学
论文信息