摘要
基于 Transformer 的大语言模型在长程任务中应用广泛,但其注意力机制随上下文长度扩展性差。本文研究一种类睡眠的巩固机制,模型周期性地将近期上下文转化为持久的快权重并清除键值缓存。睡眠期间,模型对累积上下文执行离线循环传递,通过局部学习规则更新状态空间模型块中的快权重。该方法将额外计算转移至睡眠阶段,保持推理延迟。实验表明,增加睡眠时长可显著提升需深度推理任务的性能。
AI 推荐理由
提出类睡眠机制将上下文转化为持久快权重,核心解决长程记忆与注意力扩展问题。
研究机构
卡内基梅隆大学
马里兰大学
论文信息