Vision-and-Language Navigation Visual Reasoning Future Prediction Embodied AI
摘要

现有视语言导航模型主要依赖过去和当前观测,忽视动作引发的未来视觉动态,导致缺乏对动作 - 环境变化因果关系的理解。受人类想象未来能力的启发,本文提出 LatentPilot,利用训练时的未来观测学习动作条件的视觉动态,推理时无需未来帧。该方法采用飞轮式训练机制迭代收集轨迹并重训模型,引入专家接管防止偏差;同时学习无监督的视觉潜在令牌,在连续空间中全局关注并跨步传递,使智能体能“预演”未来并推理动作对后续观测的影响。实验在多个基准上取得最先进结果,实机测试验证了其优越的环境动态理解能力。

AI 推荐理由

论文核心提出潜在视觉推理机制,通过预测未来动态增强因果理解与决策。

研究机构
University of Science and Technology of China Stanford University Amap, Alibaba Group
论文信息
作者 Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An et al.
发布日期 2026-03-31
arXiv ID 2603.29165
相关性评分 9/10 (高度相关)