摘要
近期大语言模型推理已从单次生成转向对中间状态的显式搜索。思维树(ToT)虽支持分支与回溯,但导致键值(KV)缓存急剧膨胀,成为限制吞吐量和搜索深度的内存瓶颈。本文提出 ArborKV,一种结构感知的驱逐框架。该框架结合轻量级价值估计器与树感知分配策略,通过纯令牌提取式驱逐和惰性重水合机制,在保留回溯能力的同时显著降低内存占用。实验表明,ArborKV 在保持近乎全保留精度的前提下,实现了高达 4 倍的峰值 KV 内存缩减,使得在固定硬件预算下运行更大规模的搜索配置成为可能。
AI 推荐理由
论文核心提出 ArborKV,一种针对树状推理的结构感知 KV 缓存管理机制,直接解决记忆瓶颈。
研究机构
University of Science and Technology of China
Huawei Technologies Co., Ltd.
论文信息