摘要
针对具身控制中密集视频生成计算昂贵且非必要的問題,本文研究利用图像编辑模型构建稀疏视觉世界模型。作者提出 SWEET 框架,这是一种单次拍摄的稀疏视觉规划方法,通过连续图像编辑逐步生成与任务相关的关键帧序列,并结合语言指令及空间引导。随后,利用目标条件的扩散动作预测器将想象的关键帧转化为可执行的动作块。实验表明,该方法在关键帧预测及从规划到执行的完整流程中表现优异,证明了图像编辑在具身视觉预测中的潜力。
AI 推荐理由
论文提出基于图像编辑的稀疏视觉规划框架,核心在于生成任务关键帧序列以指导机器人行动。
研究机构
Show Lab, National University of Singapore
Central South University
论文信息