Continual Learning Mixture of Experts Catastrophic Forgetting LLM Adaptation
摘要

大型语言模型的持续学习常受限于可塑性 - 稳定性困境,即获取新能力导致旧知识灾难性遗忘。现有方法通常均匀处理参数,未能区分特定任务知识与共享能力。本文提出 SETA 框架,通过自适应稀疏子空间分解为任务特定专家模块来解决该冲突。该方法将知识分离为隔离特定模式的独特专家和捕获通用特征的共享专家,并利用自适应弹性锚定及路由感知正则化保护共享知识。实验表明,SETA 在多项基准测试中优于最先进基线,显著提升了早期任务知识的保留率及反向迁移能力。

AI 推荐理由

论文核心解决持续学习中的灾难性遗忘问题,提出自适应专家架构以实现模型能力的自我进化与知识累积。

研究机构
Iowa State University, Ames, USA Argonne National Laboratory, USA
论文信息
作者 Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, Ali Jannesari
发布日期 2026-06-05
arXiv ID 2606.07500
相关性评分 9/10 (高度相关)