摘要
代理式代码任务(如故障定位和补丁生成)需在严格内存限制下处理长代码库,其中键值(KV)缓存是主要推理瓶颈。现有压缩方法仅依赖注意力信号评估令牌重要性,系统性丢弃了调用点、分支条件等对代码理解至关重要的结构关键令牌。本文提出 CodeComp,一种无需训练的 KV 缓存压缩框架,通过 Joern 提取的代码属性图先验,将静态程序分析融入大语言模型推理。实验表明,在同等内存预算下,CodeComp 在多个基准测试中优于仅基于注意力的基线,能在激进压缩下恢复大部分全上下文精度,且补丁生成质量与未压缩推理相当,可无缝集成至基于 SGLang 的代理编码流程。
AI 推荐理由
论文核心解决 Agent 编码中的 KV 缓存瓶颈,提出基于程序分析的记忆压缩架构。
研究机构
The University of Hong Kong
LMSYS Org
论文信息