摘要
持续强化学习要求智能体在获取新技能的同时保留旧知识。针对现有无模型方法因 replay 缓冲区内存需求大而面临的扩展性挑战,本文受神经科学启发,提出 ARROW 算法。该基于模型的算法扩展了 DreamerV3,采用内存高效的分布匹配回放策略,维护短期经验与长期多样性两个互补缓冲区。实验表明,在无共享结构任务中,ARROW 显著减少了遗忘现象,同时保持了相当的前向迁移能力,验证了基于模型及生物启发方法在持续学习中的潜力。
AI 推荐理由
论文核心提出双缓冲记忆架构,解决持续学习中的灾难性遗忘与扩展性问题。
研究机构
信息系,伊本·穆罕默德·本·沙特伊斯兰大学(IMSIU)
数据科学系,穆罕默德大学
新南威尔士大学计算机科学与工程学院
论文信息