Long Context Attention Mechanism Memory Efficiency Inference Optimization
摘要

现代大语言模型应用依赖长前缀控制行为,但存在影响随生成减弱及计算线性扩展的局限。现有方法或压缩前缀仍需关注,或通过训练内化参数导致更新困难。本文提出“注意力状态记忆”,一种无需训练的轻量级方法,将前缀外部化为预计算的注意力状态查找表。实验表明,该方法在有限显存下提升了准确率,显著降低延迟,并以更小内存 footprint 超越全注意力 RAG 性能。

AI 推荐理由

提出注意力状态记忆机制,核心解决长上下文记忆效率与遗忘问题。

研究机构
Institute of Science Tokyo, Japan Imperial College London, UK
论文信息
作者 Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura et al.
发布日期 2026-05-18
arXiv ID 2605.18226
相关性评分 9/10 (高度相关)