spatial reasoning ASCII representation LLM training Text2Space
摘要

本文探讨大型语言模型(LLM)是否像人类一样,能通过构建显式视觉布局来深化空间理解。作者提出 Text2Space 数据集,配对自然语言描述与真实 ASCII 网格布局,以区分表示构建失败与推理失败。研究发现 LLM 存在“读写不对称”:擅长解读但难生成 ASCII,且构建错误会导致下游推理错误。通过在布局构建任务上训练模型,显著提升了纯文本空间推理能力,即使推理时不生成 ASCII。该改进泛化至多个外部基准,证明学习构建显式布局能有效注入通用的空间理解能力。

AI 推荐理由

论文核心研究通过生成 ASCII 布局增强 LLM 的空间推理能力,直接针对推理机制。

研究机构
University of California, Santa Cruz
论文信息
作者 Shiyuan Huang, Li Liu, Jincheng He, Leilani H. Gilpin
发布日期 2026-04-16
arXiv ID 2604.14641
相关性评分 9/10 (高度相关)