摘要
视觉语言模型的时空推理需保留物理几何而非仅语义外观的视觉表示。现有方法常将几何线索视为所有视觉令牌的共享信号,忽略了不同令牌对几何证据的差异化需求。为此,本文提出 GeoWeaver,一种预推理几何基座框架。它构建多级几何库,执行令牌自适应的几何证据分配,使每个视觉令牌能检索最相关的几何抽象,并通过残差基座操作融入视觉令牌。实验表明,该方法显著增强了几何感知推理能力,证明几何信息应作为推理的表征基础而非后期融合辅助信号。
AI 推荐理由
论文核心在于通过几何基座增强视觉语言模型的时空推理能力,直接提升推理基础。
研究机构
Harbin Institute of Technology, Shenzhen
Pazhou Lab (Huangpu)
Hainan University
University of California at Merced
Pengcheng Laboratory
论文信息