KV Cache Memory Efficiency Long Context Reasoning
摘要

大型语言模型在复杂推理任务中需生成长中间思维,导致自回归解码时的键值(KV)缓存内存占用随输出长度激增。现有优化多聚焦于输入上下文压缩,忽视了长输出生成的缓存成本。本文提出 ZoomR,一种自适应将冗长推理压缩为摘要并利用动态 KV 缓存选择策略的新方法。该策略利用摘要作为粗粒度索引,仅按需“放大”检索关键细节的细粒度信息。这种分层策略避免了每步的全缓存注意力机制,显著降低内存使用。实验表明,该方法在保持竞争力的同时,将推理内存需求降低了四倍以上。

AI 推荐理由

论文核心提出多粒度 KV 缓存检索机制,直接优化推理过程中的记忆存储与访问效率。

研究机构
Rensselaer Polytechnic Institute IBM Research
论文信息
作者 David H. Yang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati et al.
发布日期 2026-04-13
arXiv ID 2604.10898
相关性评分 9/10 (高度相关)