摘要
针对无人机视觉语言导航中复杂三维环境及长程模糊多步指令的挑战,现有零样本方法常受限于大模型依赖及模块协调松散。本文提出 FineCog-Nav,一种受人类认知启发的自顶向下框架,将导航分解为语言处理、感知、记忆、推理及决策等细粒度模块。各模块由中等规模基础模型驱动,通过特定提示与结构化协议实现高效协作。此外,构建了包含句子级指令 - 轨迹对齐的 AerialVLN-Fine 基准。实验表明,该方法在指令遵循、长程规划及泛化能力上显著优于基线。
AI 推荐理由
论文提出细粒度认知模块框架,核心解决长程多步指令下的任务规划与分解问题。
研究机构
西北工业大学
南京大学
论文信息