摘要
大型语言模型的长期演进依赖于新知识的持续融入。现有方法多依赖参数更新以缓解灾难性遗忘,但存在遗忘不可避免及更新不可逆等局限。本文提出一种原则性框架,将自回归语言生成建模为词元上的马尔可夫过程,其中模型记忆由马尔可夫转移矩阵表示。在此公式下,融入新知识对应扩展状态空间,而保留现有转移则确保旧知识不丢失。我们证明了通过词元到字典映射策略融入新词元的样本复杂度界限,并提出一种仅需极少参数更新且实现零遗忘的嵌入微调算法。实验结果验证了该方法的有效性及理论发现。
AI 推荐理由
论文提出基于马尔可夫矩阵的记忆架构,核心解决知识注入与零遗忘问题。
研究机构
New Jersey Institute of Technology
University of California, Berkeley
论文信息