摘要
在模型预测控制(MPC)中,世界模型通过预测动作结果来指导最优动作选择。针对视觉 - 运动 MPC 难以预先获取目标图像且交互性受限的问题,本文提出在视觉 - 语言对齐的潜在空间中学习接地世界模型(GWM)。该方法通过评估预测结果与任务指令的嵌入相似度来打分,将视觉 - 运动 MPC 转化为具有更强语义泛化能力的视觉 - 语言动作模型。在 WISER 基准测试中,该模型在包含未见视觉信号的任务上成功率达 87%,显著优于传统方法。
AI 推荐理由
论文提出基于世界模型的规划方法,核心解决语义泛化下的任务规划与动作选择问题。
研究机构
Independent
EPFL
Beihang University
University of Toronto
NUS
论文信息