Geospatial Reasoning Self-Play Reinforcement Learning Multimodal LLM
摘要

空间推理需解决基于图像且涉及复杂场景结构的问题,但受限于标注成本高昂。本文提出 GeoX,一种无需大规模人工数据、通过可执行程序获取可验证奖励的自博弈框架。该框架利用单一多模态策略,在 abduction、deduction 和 induction 三种模式下生成并求解空间问题。验证器执行程序以提供奖励信号,通过强化学习联合优化策略。实验表明,GeoX 显著提升了基座 VLM 性能,平均提高 5.5 分,媲美或超越基于百万级 curated 数据训练的基准,并发布了对应的自博弈基准数据集。

AI 推荐理由

论文核心在于通过自博弈提升多模态模型的空间逻辑推理能力,涉及归纳、演绎等推理模式。

研究机构
KAIST MPI-SWS MPI-SP
论文信息
作者 Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi, Meeyoung Cha
发布日期 2026-05-19
arXiv ID 2605.20006
相关性评分 9/10 (高度相关)