摘要
本文提出世界 - 语言 - 动作(WLA)模型,作为一种新型具身基础模型。WLA 结合文本指令、图像及机器人状态,联合预测文本子任务、子目标图像及机器人动作。其核心采用自回归 Transformer 架构预测包含语义意图与物理动态的下一状态,利用世界专家监督物理动态以辅助动作生成。该模型支持测试时缩放以提升控制性能,并在模拟与真实环境中展现出卓越的长程任务规划与多任务学习能力,甚至能从无动作标注的跨具身视频中学习新任务。
AI 推荐理由
论文核心在于通过世界建模预测子任务和子目标图像,以解决复杂长程任务,属于高级规划。
研究机构
SJTU
HUST
SCUT
ECUST
SHU
NJUPT
论文信息