摘要
本文提出 WorldVLN,首个用于空中视觉语言导航的自回归世界动作模型。该模型将导航视为预测驱动问题,利用潜在自回归视频骨干网预测短时世界状态转移,并直接解码为可执行航点动作。通过闭环反馈机制,新观测被编码回上下文以优化后续预测。文章引入两阶段训练框架,结合指令条件导航动态与专为自回归世界动作模型设计的 Action-aware GRPO 强化学习算法,显著提升了任务成功率,并在真实无人机部署中实现了零样本迁移。
AI 推荐理由
论文提出基于世界模型的自回归动作预测,核心在于通过预测未来状态进行短视距规划与决策。
研究机构
Tsinghua University
Shandong University
Manifold AI
Beijing Institute of Technology
Northeastern University
论文信息