Self-Evolution Spatial Reasoning VLM GRPO Logical Consistency
摘要

视觉语言模型(VLM)的空间推理能力依然脆弱,常在输入变换下失效。为此,本文提出“通过几何进化进行空间对齐”(SAGE)框架,这是一种自进化方法,利用几何与语言对偶操作强制模型保持逻辑一致性。该方法将对偶一致性作为辅助奖励纳入 GRPO 训练,并通过动态操作池持续探测不一致性,聚焦高信息量信号。实验表明,SAGE 在视频和空间推理基准上显著优于强基线,且具备更强的泛化能力。

AI 推荐理由

论文提出自进化框架 SAGE,核心机制是通过几何逻辑一致性驱动模型自我改进与持续学习。

研究机构
上海人工智能实验室 纽约大学 香港中文大学
论文信息
作者 Junming Liu, Yuqi Li, Yifei Sun, Maonan Wang, Piotr Koniusz et al.
发布日期 2026-05-18
arXiv ID 2605.18162
相关性评分 9/10 (高度相关)