Vision-Language-Action Episodic Memory Long-horizon Manipulation Failure Recovery
摘要

视觉 - 语言 - 动作(VLA)模型在长程操作任务中表现系统性失败。本文指出仅扩展上下文长度无法解决该问题,根源在于执行循环中的记忆、验证与恢复缺口。为此提出 HELM 框架,包含通过 CLIP 索引关键帧检索历史的情景记忆模块、预测动作失败的状态验证器及执行回滚重规划的控制器。实验表明,该方法在 LIBERO-LONG 数据集上显著优于基线,有效提升了长程任务成功率及抗干扰恢复能力。

AI 推荐理由

论文核心提出情景记忆模块解决长程任务失败,记忆机制是关键创新。

研究机构
清华大学 阿里巴巴集团 北京邮电大学
论文信息
作者 Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li
发布日期 2026-04-20
arXiv ID 2604.18791
相关性评分 9/10 (高度相关)