Vision-Language Navigation Self-aware Reasoning End-to-end Learning VLM Habitat Simulator
摘要

视觉语言导航(VLN)要求智能体将语言指令与其在视觉环境中的运动相结合。现有方法虽利用视觉语言模型进行端到端动作预测,但缺乏对智能体、指令与场景间关系的显式理解。为此,本文提出 AwareVLN 框架,通过自感知推理机制使模型以端到端数据驱动方式理解自身状态与任务进度。该方法包含两大创新:一是促进空间与任务导向自感知的结构化推理模块;二是用于高效训练的自动数据引擎。实验表明其在多个数据集上显著优于现有最先进方法。

AI 推荐理由

论文核心提出自感知推理机制,显式建模智能体状态与任务进展关系,属推理能力研究。

研究机构
Tsinghua University
论文信息
作者 Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin et al.
发布日期 2026-05-21
arXiv ID 2605.22816
相关性评分 9/10 (高度相关)