摘要
长程代理任务(如深度研究)需跨多源信息进行多跳推理,导致外部检索令牌主导上下文,引发内存激增并限制解码性能。现有 KV 缓存压缩启发式方法难以有效支持多步推理模型。为此,本文提出 SideQuest,利用大推理模型自身通过推理判断上下文令牌效用,执行 KV 缓存压缩。为避免管理过程污染模型记忆,将该压缩作为与主推理任务并行执行的辅助任务。实验表明,仅用 215 个样本训练的模型即可在代理任务中将峰值令牌使用量降低高达 65%,且精度损失极小,优于现有启发式技术。
AI 推荐理由
论文核心提出基于模型驱动的 KV 缓存管理机制,直接解决长程任务中的记忆效率问题。
研究机构
NVIDIA
论文信息