摘要
现有的空中视觉语言导航(VLN)方法主要采用检测与规划流水线,将开放词汇检测转化为离散文本场景图,受限于空间推理能力不足及语言歧义。为此,本文提出一种视觉空间推理(ViSA)增强框架。该框架设计了三阶段协同架构,利用结构化视觉提示,使视觉语言模型无需额外训练或复杂中间表示即可直接在图像平面上进行推理。在 CityNav 基准上的综合评估表明,ViSA 增强型 VLN 的成功率较全训练的最先进方法提升了 70.3%,展现了其作为空中 VLN 系统骨干的巨大潜力。
AI 推荐理由
论文核心提出视觉空间推理框架,直接解决现有方法空间推理能力不足的瓶颈。
研究机构
清华大学
中国科学院自动化研究所
论文信息