摘要
大型语言模型通过微调获取新能力时,持续适应常导致灾难性遗忘。本文提出 CRAFT 框架,不更新模型权重,转而学习隐藏表示的低秩干预。该方法分三阶段:基于输出分布差异路由任务至相似组;利用 KL 散度对抗组先验状态进行微调以控制遗忘;最后将干预合并至共享表示。实验表明,CRAFT 在多个基准和模型规模上优于强 LoRA 基线,显著提升性能并减少遗忘,且对任务顺序鲁棒。
AI 推荐理由
论文提出持续学习框架解决灾难性遗忘,核心关注模型自适应与自我进化能力。
研究机构
Iowa State University, USA
Maro Systems, USA
University of California, Berkeley
AMD
论文信息