Vision-and-Language Navigation Structured Inference Zero-Shot Learning Embodied AI
摘要

连续环境中的零样本视觉语言导航(VLN-CE)对现代视觉语言模型极具挑战。尽管模型具备语义先验,但开放式推理难以转化为稳定的长程具身执行。本文指出瓶颈在于缺乏组织指令跟随、感知接地及进度验证的执行结构。为此,提出 EmergeNav 框架,将导航建模为结构化具身推理。该方法结合“规划 - 求解 - 转移”层级架构、目标条件感知提取及对比双重记忆推理,实现了无需特定训练或显式地图的强零样本性能,证明了显式执行结构是将先验转化为稳定导航行为的关键。

AI 推荐理由

论文提出分层规划架构解决长程执行问题,核心贡献在于结构化任务规划机制。

研究机构
佛山创新学院 东北大学
论文信息
作者 Kun Luo, Xiaoguang Ma
发布日期 2026-03-16
arXiv ID 2603.16947
相关性评分 9/10 (高度相关)