KV Cache Tree-of-Thoughts Memory Management LLM Inference
摘要

近期大语言模型推理已从单次生成转向对中间状态的显式搜索。思维树(ToT)虽支持分支与回溯,但导致键值(KV)缓存急剧膨胀,成为限制吞吐量和搜索深度的内存瓶颈。本文提出 ArborKV,一种结构感知的驱逐框架。该框架结合轻量级价值估计器与树感知分配策略,通过纯令牌提取式驱逐和惰性重水合机制,在保留回溯能力的同时显著降低内存占用。实验表明,ArborKV 在保持近乎全保留精度的前提下,实现了高达 4 倍的峰值 KV 内存缩减,使得在固定硬件预算下运行更大规模的搜索配置成为可能。

AI 推荐理由

论文核心提出 ArborKV,一种针对树状推理的结构感知 KV 缓存管理机制,直接解决记忆瓶颈。

研究机构
University of Science and Technology of China Huawei Technologies Co., Ltd.
论文信息
作者 Yeqiu Chen, Ziyan Liu, Zhenxin Huang, Runquan Gui, Hong Wang et al.
发布日期 2026-05-21
arXiv ID 2605.22106
相关性评分 9/10 (高度相关)