摘要
本文提出 Context-Nav,旨在解决文本目标实例导航任务,即智能体需根据自由描述在同类干扰物中定位目标。该方法将长上下文标题从局部匹配线索提升为全局探索先验,并通过 3D 空间推理验证候选对象。首先,计算密集图文对齐生成值地图以引导探索;其次,执行视点感知关系检查,仅在至少一个观测姿态下满足空间关系时确认目标。无需特定训练即可在 InstanceNav 和 CoIN-Bench 上取得最先进性能,证明了几何基础的空间推理是解决复杂场景细粒度消歧的可扩展方案。
AI 推荐理由
论文核心提出基于 3D 空间推理的验证机制,利用几何 grounding 解决实例消歧,属推理能力研究。
研究机构
韩国光州科学技术院人工智能系
论文信息