摘要
视觉语言模型(VLM)在静态视觉理解上表现优异,但在涉及自我运动下场景演化的动态空间推理方面仍显不足。现有方法要么缺乏对运动条件状态转移的显式建模,要么在推理时耦合世界模型导致计算开销巨大。本文提出 World2VLM 框架,将生成式世界模型的空间想象力蒸馏至 VLM 中。利用视角一致的世界模型合成几何对齐的未来视图,为正向和逆向空间推理提供结构化监督。实验表明,该方法在多个基准测试中显著优于基线及推理时耦合方法,证明了世界模型作为训练期教师的有效性。
AI 推荐理由
论文核心致力于提升 VLM 的动态空间推理能力,通过蒸馏世界模型实现场景演化想象。
研究机构
中国科学院自动化研究所
清华大学
论文信息