Vision-and-Language Navigation Zero-shot Learning Hierarchical Reasoning Embodied AI
摘要

视觉语言导航(VLN)要求具身智能体在未知环境中将自然语言指令转化为可执行的导航动作。现有零样本方法常依赖额外的航点预测模块,导致高层方向推理与细粒度局部定位纠缠,决策易错且不稳定。本文提出 P2DNav,一种用于零样本 VLN 的分层框架,包含三个核心组件:全景至俯视(P2D)、滑动窗口对话记忆(SDM)和反思重定向机制(RRM)。P2D 将导航决策显式分解为全景方向选择与俯视局部定位两个阶段;SDM 将导航历史组织为多轮对话上下文以支持长程导航;RRM 则通过评估局部定位可靠性实现反思性重定向。实验表明该方法在零样本设置下显著优于现有技术。

AI 推荐理由

论文核心提出分层推理框架,显式分解导航决策为全景方向选择与局部定位两阶段推理过程。

研究机构
中国科学院自动化研究所
论文信息
作者 Kai Sheng, Liuyi Wang, Haojie Dai, Jinlong Li, Yongrui Qin et al.
发布日期 2026-05-19
arXiv ID 2605.19634
相关性评分 9/10 (高度相关)