摘要
视觉 - 语言 - 动作(VLA)模型在长程操作任务中表现系统性失败。本文指出仅扩展上下文长度无法解决该问题,根源在于执行循环中的记忆、验证与恢复缺口。为此提出 HELM 框架,包含通过 CLIP 索引关键帧检索历史的情景记忆模块、预测动作失败的状态验证器及执行回滚重规划的控制器。实验表明,该方法在 LIBERO-LONG 数据集上显著优于基线,有效提升了长程任务成功率及抗干扰恢复能力。
AI 推荐理由
论文核心提出情景记忆模块解决长程任务失败,记忆机制是关键创新。
研究机构
清华大学
阿里巴巴集团
北京邮电大学
论文信息