摘要
视觉语言模型在不同视角下常产生不一致的物体描述,阻碍具身智能体构建一致的语义表示。本文提出一种统一的记忆增强视觉语言智能体,在单一自回归框架内协同处理数据关联、物体描述及探索策略。该模型整合当前观测、拓扑地图及序列化的物体级情景记忆,确保长序列中物体身份与语义的一致性。通过基于分歧的策略和伪描述模型收集数据进行自监督训练,实验表明其在描述评分和自相似度上显著优于基线,实现了可扩展的场景表示。
AI 推荐理由
论文提出记忆增强架构,利用情景记忆解决多视角语义一致性问题,是核心机制。
研究机构
意大利技术研究院,热那亚,意大利
论文信息