Spatial Reasoning Vision Language Models Explicit Grounding Token Generation
摘要

大型视觉语言模型(LVLMs)擅长语义理解,但在细粒度空间定位上表现不佳,因其需隐式推断复杂几何结构。本文提出 Perceptio,一种具备 2D 和 3D 空间推理能力的感知增强型 LVLM。该方法通过在自回归序列中直接生成显式的语义分割令牌和深度令牌,使模型先输出空间信息再回答问题。研究蒸馏了单目教师模型的深度码本以量化深度,并引入复合深度令牌目标及软合并技术以稳定生成。多任务协同训练策略使模型在多个基准测试中达到最先进水平,显著提升了空间定位准确率,证明了显式空间思维链的有效性。

AI 推荐理由

论文核心在于通过显式生成空间令牌增强模型的空间推理与几何理解能力,属于推理范畴。

研究机构
Amazon
论文信息
作者 Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler
发布日期 2026-03-19
arXiv ID 2603.18795
相关性评分 9/10 (高度相关)