Embodied AI External Memory Vision-Language-Action Robotics
摘要

针对具身控制中视觉 - 语言策略存在的模态竞争及知识扩展依赖主干更新问题,本文提出 Key-Gram 条件记忆框架。该框架通过记忆模块将指令分解为特定任务的关键语法,利用确定性哈希查找检索静态语言先验,并经上下文感知门控注入隐藏层。此设计使主干网络专注于视觉推理,而可复用知识存储于外部记忆。实验表明,该方法在多个基准及真实世界中显著提升了组合 grounding、迁移能力及长程操作性能。

AI 推荐理由

论文提出基于条件记忆的框架,核心创新在于将语言知识外化为可扩展的外部记忆模块。

研究机构
清华大学计算机科学与技术系 清华大学自动化系
论文信息
作者 Jingjing Fan, Siyuan Li, Botao Ren, Zhidong Deng
发布日期 2026-05-18
arXiv ID 2605.18556
相关性评分 9/10 (高度相关)