Long-Context LLM Sparse Attention Memory Efficiency KV Cache Pruning
摘要

针对大语言模型难以泛化至预训练上下文长度之外的问题,本文提出 L2A(Learning To Attend)层。该方法通过逐令牌决策是否调用全局注意力,实现条件式长程记忆访问。实验表明,L2A 在跳过约 80% 令牌全局注意力的情况下,性能仅比标准长上下文训练低 3%,并将有效上下文从 32K 扩展至 128K。此外,自定义 Triton 内核显著提升了训练吞吐量,并支持后训练剪枝,减少高达 50% 的 KV 缓存显存占用。

AI 推荐理由

提出条件记忆访问机制,核心解决长上下文中的全局注意力与显存优化问题。

研究机构
AWS, 美国亚马逊云科技公司 加州大学洛杉矶分校, 美国
论文信息
作者 Sakshi Choudhary, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez, Matthew Trager et al.
发布日期 2026-03-18
arXiv ID 2603.17484
相关性评分 9/10 (高度相关)