摘要
大型视觉语言模型(VLM)虽具备卓越的语义理解力,但在深度排序和坐标定位等基础几何任务的空间推理上表现欠佳。现有方法受限于场景中心数据集的规模与多样性。为此,本文提出 SpatialForge,一种可扩展的数据合成流水线,能将野外 2D 图像转化为空间推理监督信号。该方法将空间推理分解为感知与关系,构建涵盖深度、布局及视角依赖推理的结构化监督,并引入自动验证机制。基于此构建了含 1000 万对空间问答的 SpatialForge-10M 数据集。实验表明,该数据显著提升了标准 VLM 的空间推理能力,证实了利用规模化 2D 数据增强 3D 感知推理的有效性。
AI 推荐理由
论文核心致力于解决 VLM 的空间推理缺陷,通过构建大规模数据集显著提升几何与空间推理能力。
研究机构
Lingnan University
XPENG Robotics
论文信息