摘要
现有视觉 - 语言 - 动作模型因依赖即时观测,难以泛化至长程任务。针对其捕捉非马尔可夫依赖的不足,本文提出关键帧链式 VLA 框架。该方法通过自动关键帧选择器学习判别性嵌入空间,识别状态转移;设计进度感知查询机制,动态检索与当前执行阶段时间相关的关键历史帧。这些关键帧作为交错视觉令牌集成到模型中,使策略明确 grounded 于长程时序上下文。实验表明,该方法在长程依赖任务中表现优异。
AI 推荐理由
论文核心提出关键帧链式机制,显式建模长程非马尔可夫依赖,属于记忆架构创新。
研究机构
Equal contribution Tongji University University of Technology Sydney
论文信息