VLA Long-Horizon Tasks Non-Markovian Robot Manipulation Keyframe Retrieval
摘要

现有视觉 - 语言 - 动作模型因依赖即时观测,难以泛化至长程任务。针对其捕捉非马尔可夫依赖的不足,本文提出关键帧链式 VLA 框架。该方法通过自动关键帧选择器学习判别性嵌入空间,识别状态转移;设计进度感知查询机制,动态检索与当前执行阶段时间相关的关键历史帧。这些关键帧作为交错视觉令牌集成到模型中,使策略明确 grounded 于长程时序上下文。实验表明,该方法在长程依赖任务中表现优异。

AI 推荐理由

论文核心提出关键帧链式机制,显式建模长程非马尔可夫依赖,属于记忆架构创新。

研究机构
Equal contribution Tongji University University of Technology Sydney
论文信息
作者 Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li et al.
发布日期 2026-03-02
arXiv ID 2603.01465
相关性评分 9/10 (高度相关)