摘要
现代大语言模型应用依赖长前缀控制行为,但存在影响随生成减弱及计算线性扩展的局限。现有方法或压缩前缀仍需关注,或通过训练内化参数导致更新困难。本文提出“注意力状态记忆”,一种无需训练的轻量级方法,将前缀外部化为预计算的注意力状态查找表。实验表明,该方法在有限显存下提升了准确率,显著降低延迟,并以更小内存 footprint 超越全注意力 RAG 性能。
AI 推荐理由
提出注意力状态记忆机制,核心解决长上下文记忆效率与遗忘问题。
研究机构
Institute of Science Tokyo, Japan
Imperial College London, UK
论文信息