Vision-Language Models Geo-Localization Adaptive Reasoning GRPO
摘要

视觉语言模型为全球图像地理定位带来了新范式,但现有检索增强生成受限于数据库质量,而推理驱动方法因依赖固定深度的推理路径导致幻觉增加且效率低下。为此,本文提出优化可定位性评分以量化图像适合深度推理的程度,并构建分层推理数据集 Geo-ADAPT-51K。在此基础上,作者提出两阶段群组相对策略优化课程,通过定制奖励函数调节自适应推理深度、视觉接地及层级地理准确性。该框架实现了最先进的性能并显著减少了幻觉。

AI 推荐理由

论文核心提出自适应推理策略,动态调整推理深度以解决地理定位中的幻觉问题。

研究机构
犹他大学 俄克拉荷马大学 伍斯特理工学院 伊利诺伊大学芝加哥分校
论文信息
作者 Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo et al.
发布日期 2026-03-13
arXiv ID 2603.13628
相关性评分 9/10 (高度相关)