spatial reasoning vision-language models orthographic views mental rotation
摘要

当前大语言模型虽具备奥林匹克级逻辑能力,但视觉语言模型却在积木计数等基础空间任务上表现不佳,揭示了“空间智能缺口”。本文指出瓶颈在于缺乏视图一致的空间接口。为此,提出 3ViewSense 框架,借鉴工程认知提出“模拟 - 推理”机制,将复杂场景分解为标准正交投影以消除几何歧义。通过对齐自我中心感知与非自我中心参考,促进显式的心理旋转与重建。实验表明,该方法在遮挡计数和视图一致性推理上显著优于现有基线,提升了多模态系统空间描述的稳定性与一致性。

AI 推荐理由

论文核心提出空间推理框架,解决视觉语言模型的空间智能缺口,属推理能力研究。

研究机构
中国科学院
论文信息
作者 Shaoxiong Zhan, Yanlin Lai, Zheng Liu, Hai Lin, Shen Li et al.
发布日期 2026-03-08
arXiv ID 2603.07751
相关性评分 9/10 (高度相关)