Vision-Language Navigation Spatial Reasoning Topological Graph VLM
摘要

视觉语言导航(VLN)因大型视觉语言模型(VLM)预训练于静态任务而面临架构不匹配挑战。现有方法常将空间信息转化为文本,导致隐式推理复杂关系或限制全局行动能力。为此,本文提出 TagaVLM,一种端到端框架,显式将拓扑结构注入 VLM 主干。通过空间拓扑感知残差注意力机制直接整合边信息,实现内在空间推理;利用交错导航提示增强节点级视文对齐。嵌入拓扑图后,模型具备全局动作推理能力,支持鲁棒路径修正。在 R2R 基准测试中,该方法在未见环境中取得最先进性能。

AI 推荐理由

论文核心提出拓扑感知的全局动作推理框架,显式增强 VLM 的空间推理能力。

研究机构
中国科学院自动化研究所
论文信息
作者 Jiaxing Liu, Zexi Zhang, Xiaoyan Li, Boyue Wang, Yongli Hu et al.
发布日期 2026-03-03
arXiv ID 2603.02972
相关性评分 9/10 (高度相关)