时空推理 几何基座 多模态大模型 视觉表示学习
摘要

视觉语言模型的时空推理需保留物理几何而非仅语义外观的视觉表示。现有方法常将几何线索视为所有视觉令牌的共享信号,忽略了不同令牌对几何证据的差异化需求。为此,本文提出 GeoWeaver,一种预推理几何基座框架。它构建多级几何库,执行令牌自适应的几何证据分配,使每个视觉令牌能检索最相关的几何抽象,并通过残差基座操作融入视觉令牌。实验表明,该方法显著增强了几何感知推理能力,证明几何信息应作为推理的表征基础而非后期融合辅助信号。

AI 推荐理由

论文核心在于通过几何基座增强视觉语言模型的时空推理能力,直接提升推理基础。

研究机构
Harbin Institute of Technology, Shenzhen Pazhou Lab (Huangpu) Hainan University University of California at Merced Pengcheng Laboratory
论文信息
作者 Deshui Miao, Xingsen Huang, Yameng Gu, Xin Li, Haijun Zhang et al.
发布日期 2026-05-21
arXiv ID 2605.22558
相关性评分 9/10 (高度相关)