long-context state-space-model consolidation fast-weights
摘要

基于 Transformer 的大语言模型在长程任务中应用广泛,但其注意力机制随上下文长度扩展性差。本文研究一种类睡眠的巩固机制,模型周期性地将近期上下文转化为持久的快权重并清除键值缓存。睡眠期间,模型对累积上下文执行离线循环传递,通过局部学习规则更新状态空间模型块中的快权重。该方法将额外计算转移至睡眠阶段,保持推理延迟。实验表明,增加睡眠时长可显著提升需深度推理任务的性能。

AI 推荐理由

提出类睡眠机制将上下文转化为持久快权重,核心解决长程记忆与注意力扩展问题。

研究机构
卡内基梅隆大学 马里兰大学
论文信息
作者 Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti
发布日期 2026-05-25
arXiv ID 2605.26099
相关性评分 9/10 (高度相关)