摘要
针对单视角观测下视觉 - 语言模型(VLM)轨迹预测不稳定及世界模型缺乏落地信号的问题,本文提出 WorldMAP 师生框架。该方法利用世界模型生成的未来视频构建语义空间记忆,通过显式规划产生轨迹伪标签作为监督信号,训练轻量级学生模型直接从视觉 - 语言输入中预测导航轨迹。实验表明,该方法在 Target-Bench 上显著降低了平均位移误差和最终位移误差,证明了世界模型在合成结构化监督信号以辅助导航学习方面的核心价值。
AI 推荐理由
论文核心在于利用世界模型生成规划伪标签,直接提升具身导航中的轨迹预测与任务规划能力。
研究机构
Harbin Institute of Technology
University of Science and Technology of China
Shandong University
Tsinghua University
论文信息