摘要
大型语言模型在复杂推理任务中需生成长中间思维,导致自回归解码时的键值(KV)缓存内存占用随输出长度激增。现有优化多聚焦于输入上下文压缩,忽视了长输出生成的缓存成本。本文提出 ZoomR,一种自适应将冗长推理压缩为摘要并利用动态 KV 缓存选择策略的新方法。该策略利用摘要作为粗粒度索引,仅按需“放大”检索关键细节的细粒度信息。这种分层策略避免了每步的全缓存注意力机制,显著降低内存使用。实验表明,该方法在保持竞争力的同时,将推理内存需求降低了四倍以上。
AI 推荐理由
论文核心提出多粒度 KV 缓存检索机制,直接优化推理过程中的记忆存储与访问效率。
研究机构
Rensselaer Polytechnic Institute
IBM Research
论文信息