摘要
针对视觉语言导航从指令跟随向目标导向自主性的转变,本文提出 HaltNav 分层框架。该方法利用轻量级文本拓扑图(osmAG)进行鲁棒的全局规划,并结合多模态大模型实现高层任务落地。通过引入“反应式视觉停止”机制,代理能检测局部异常、更新拓扑并触发重规划以规避障碍。实验表明,该框架在无需繁琐指令的情况下,显著提升了长程导航在动态环境中的鲁棒性。
AI 推荐理由
论文提出分层导航框架,核心在于结合全局拓扑规划与局部反应式重规划机制。
研究机构
中国科学院自动化研究所
论文信息