Spatial Reasoning Data Synthesis Vision-Language Models 3D Awareness
摘要

大型视觉语言模型(VLM)虽具备卓越的语义理解力,但在深度排序和坐标定位等基础几何任务的空间推理上表现欠佳。现有方法受限于场景中心数据集的规模与多样性。为此,本文提出 SpatialForge,一种可扩展的数据合成流水线,能将野外 2D 图像转化为空间推理监督信号。该方法将空间推理分解为感知与关系,构建涵盖深度、布局及视角依赖推理的结构化监督,并引入自动验证机制。基于此构建了含 1000 万对空间问答的 SpatialForge-10M 数据集。实验表明,该数据显著提升了标准 VLM 的空间推理能力,证实了利用规模化 2D 数据增强 3D 感知推理的有效性。

AI 推荐理由

论文核心致力于解决 VLM 的空间推理缺陷,通过构建大规模数据集显著提升几何与空间推理能力。

研究机构
Lingnan University XPENG Robotics
论文信息
作者 Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang et al.
发布日期 2026-05-12
arXiv ID 2605.11462
相关性评分 9/10 (高度相关)