摘要
视觉语言模型(VLM)的空间推理能力依然脆弱,常在输入变换下失效。为此,本文提出“通过几何进化进行空间对齐”(SAGE)框架,这是一种自进化方法,利用几何与语言对偶操作强制模型保持逻辑一致性。该方法将对偶一致性作为辅助奖励纳入 GRPO 训练,并通过动态操作池持续探测不一致性,聚焦高信息量信号。实验表明,SAGE 在视频和空间推理基准上显著优于强基线,且具备更强的泛化能力。
AI 推荐理由
论文提出自进化框架 SAGE,核心机制是通过几何逻辑一致性驱动模型自我改进与持续学习。
研究机构
上海人工智能实验室
纽约大学
香港中文大学
论文信息