摘要
视觉语言导航(VLN)因大型视觉语言模型(VLM)预训练于静态任务而面临架构不匹配挑战。现有方法常将空间信息转化为文本,导致隐式推理复杂关系或限制全局行动能力。为此,本文提出 TagaVLM,一种端到端框架,显式将拓扑结构注入 VLM 主干。通过空间拓扑感知残差注意力机制直接整合边信息,实现内在空间推理;利用交错导航提示增强节点级视文对齐。嵌入拓扑图后,模型具备全局动作推理能力,支持鲁棒路径修正。在 R2R 基准测试中,该方法在未见环境中取得最先进性能。
AI 推荐理由
论文核心提出拓扑感知的全局动作推理框架,显式增强 VLM 的空间推理能力。
研究机构
中国科学院自动化研究所
论文信息