摘要
尽管视觉语言模型(VLM)具备较强的视觉推理能力,但其空间推理仍受限于观测图像及文本思维链,难以推断未观测布局或保持跨视角一致性。本文提出“借助想象思考”范式,使 VLM 在与世界模拟器交互中主动获取想象的视觉证据。我们构建了 Astra 框架,结合强化学习训练的 VLM 策略与基于 Bagel 的世界模拟器,生成新视角观测。通过视图一致性微调及两阶段强化学习课程,模型学会了何时及如何调用模拟器以优化推理。实验表明,想象的观测能显著提升空间推理性能。
AI 推荐理由
论文核心研究利用世界模拟器进行视觉空间推理,通过想象增强推理能力。
研究机构
The University of Hong Kong
Shanghai AI Laboratory
Shanghai Jiao Tong University
Fudan University
Beihang University
论文信息