摘要
当前视觉 - 语言 - 动作模型在部分可观测下的长程操作中表现不佳,常因依赖短上下文导致任务进度丢失。本文提出 RB-VLA,一种以信念为中心的架构,通过自监督世界模型目标训练,维持紧凑的潜在状态以编码任务相关历史、动力学及物体交互。该模型仅需一次查询获取高层意图,由信念模块追踪进度并支持因果控制,无需存储原始观测或随时间扩展记忆。实验表明,其在多阶段任务中成功率显著提升,推理延迟降低五倍,证明了基于信念的状态表示对长程策略的有效性。
AI 推荐理由
论文核心提出基于信念的记忆架构,解决长程任务中的状态保持与历史编码问题。
研究机构
印度理工学院工程系,印度金奈
论文信息