摘要
多模态大语言模型的持续学习旨在顺序获取知识同时缓解灾难性遗忘,但现有方法存在局限。本文提出 Octopus,一种基于无历史梯度正交化(HiFGO)的两阶段持续学习框架,无需历史任务数据即可强制梯度级正交性。该两阶段微调策略将任务适应与正则化解耦,实现了可塑性与稳定性的原则性平衡。UCIT 实验表明,Octopus 确立了最先进性能,在平均值和最后指标上分别超越 prior SOTA 2.14% 和 6.82%。
AI 推荐理由
论文核心研究持续学习与自我改进机制,解决灾难性遗忘,属于 Agent 自我进化范畴。
研究机构
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University
vivo Mobile Communication Co., Ltd.
论文信息