摘要
现有视语言导航模型主要依赖过去和当前观测,忽视动作引发的未来视觉动态,导致缺乏对动作 - 环境变化因果关系的理解。受人类想象未来能力的启发,本文提出 LatentPilot,利用训练时的未来观测学习动作条件的视觉动态,推理时无需未来帧。该方法采用飞轮式训练机制迭代收集轨迹并重训模型,引入专家接管防止偏差;同时学习无监督的视觉潜在令牌,在连续空间中全局关注并跨步传递,使智能体能“预演”未来并推理动作对后续观测的影响。实验在多个基准上取得最先进结果,实机测试验证了其优越的环境动态理解能力。
AI 推荐理由
论文核心提出潜在视觉推理机制,通过预测未来动态增强因果理解与决策。
研究机构
University of Science and Technology of China
Stanford University
Amap, Alibaba Group
论文信息