KV Cache Chain-of-Thought Inference Efficiency Resource Allocation
摘要

大型语言模型在长思维链推理中因键值(KV)缓存快速增长而面临严重推理瓶颈。现有解码时压缩方法通常假设各层和头的预算均匀分布,忽略了自回归推理中逐步变化的上下文需求。为此,本文提出 ReasonAlloc,一种无需训练的框架,将解码时 KV 压缩重构为层次化预算分配问题。该框架包含离线层间预分配策略以捕捉“推理波”架构模式,以及在线头间重分配策略以实时优化资源。实验表明,ReasonAlloc 在数学推理基准上显著优于现有方法,尤其在低预算场景下表现优异,且几乎无额外推理开销。

AI 推荐理由

论文专为优化长思维链推理设计,解决推理过程中的显存瓶颈,核心聚焦推理效率。

研究机构
清华大学 香港大学 北京大学 深圳大学 中国科学院自动化研究所
论文信息
作者 Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang et al.
发布日期 2026-06-09
arXiv ID 2606.11164
相关性评分 9/10 (高度相关)