摘要
使视觉 - 语言模型(VLM)具备空间推理能力仍具挑战。现有方法将 VLM 视为被动观察者,且强化学习依赖稀疏奖励。受鸽子构建认知地图导航的启发,本文提出一种新型代理流程。首先,引入参数化场景布局的动态认知地图作为持久记忆;其次,提出描述空间关系的 Python 表达式“空间断言代码”(SAC)。SAC 与认知地图协作,验证中间推理步骤并提供密集奖励信号。通过监督与强化微调,模型在 MindCube 基准测试中取得最先进性能,整体准确率达 80.5%。
AI 推荐理由
论文核心解决 VLM 空间推理难题,提出认知地图与断言代码增强推理步骤验证。
研究机构
State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China
School of Digital Media & Design Arts, Correspondence to: Mengshi Qi
论文信息