Visual Spatial Reasoning World Simulator Vision-Language Models Imagination Reinforcement Learning
摘要

尽管视觉语言模型(VLM)具备较强的视觉推理能力,但其空间推理仍受限于观测图像及文本思维链,难以推断未观测布局或保持跨视角一致性。本文提出“借助想象思考”范式,使 VLM 在与世界模拟器交互中主动获取想象的视觉证据。我们构建了 Astra 框架,结合强化学习训练的 VLM 策略与基于 Bagel 的世界模拟器,生成新视角观测。通过视图一致性微调及两阶段强化学习课程,模型学会了何时及如何调用模拟器以优化推理。实验表明,想象的观测能显著提升空间推理性能。

AI 推荐理由

论文核心研究利用世界模拟器进行视觉空间推理,通过想象增强推理能力。

研究机构
The University of Hong Kong Shanghai AI Laboratory Shanghai Jiao Tong University Fudan University Beihang University
论文信息
作者 Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang et al.
发布日期 2026-06-04
arXiv ID 2606.06476
相关性评分 9/10 (高度相关)