World Model Vision-Language Navigation Reinforcement Learning Autoregressive Modeling Drone Control
摘要

本文提出 WorldVLN,首个用于空中视觉语言导航的自回归世界动作模型。该模型将导航视为预测驱动问题,利用潜在自回归视频骨干网预测短时世界状态转移,并直接解码为可执行航点动作。通过闭环反馈机制,新观测被编码回上下文以优化后续预测。文章引入两阶段训练框架,结合指令条件导航动态与专为自回归世界动作模型设计的 Action-aware GRPO 强化学习算法,显著提升了任务成功率,并在真实无人机部署中实现了零样本迁移。

AI 推荐理由

论文提出基于世界模型的自回归动作预测,核心在于通过预测未来状态进行短视距规划与决策。

研究机构
Tsinghua University Shandong University Manifold AI Beijing Institute of Technology Northeastern University
论文信息
作者 Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang et al.
发布日期 2026-05-15
arXiv ID 2605.15964
相关性评分 9/10 (高度相关)