Continual Reinforcement Learning World Models Catastrophic Forgetting Replay Buffer Bio-inspired AI
摘要

持续强化学习要求智能体在获取新技能的同时保留旧知识。针对现有无模型方法因 replay 缓冲区内存需求大而面临的扩展性挑战,本文受神经科学启发,提出 ARROW 算法。该基于模型的算法扩展了 DreamerV3,采用内存高效的分布匹配回放策略,维护短期经验与长期多样性两个互补缓冲区。实验表明,在无共享结构任务中,ARROW 显著减少了遗忘现象,同时保持了相当的前向迁移能力,验证了基于模型及生物启发方法在持续学习中的潜力。

AI 推荐理由

论文核心提出双缓冲记忆架构,解决持续学习中的灾难性遗忘与扩展性问题。

研究机构
信息系,伊本·穆罕默德·本·沙特伊斯兰大学(IMSIU) 数据科学系,穆罕默德大学 新南威尔士大学计算机科学与工程学院
论文信息
作者 Abdulaziz Alyahya, Abdallah Al Siyabi, Markus R. Ernst, Luke Yang, Levin Kuhlmann et al.
发布日期 2026-03-12
arXiv ID 2603.11395
相关性评分 9/10 (高度相关)