KV Cache Agent System Memory Management Inference Optimization
摘要

现代 KV 缓存管理假设聊天机器人工作负载为只增模式,但这不适用于需策略性编辑对话历史的代理型 LLM。针对现有系统无法按策略主动移除或替换缓存片段的问题,本文提出 Leyline,一种服务侧原语。它通过声明式指令分离编辑内容与位置校正,利用架构无关接口调用内核进行 RoPE 旋转修正,实现原位拼接或前缀修剪。实验表明,该方法显著提升了缓存命中率、降低了延迟,并提高了代理任务的解决率。

AI 推荐理由

论文提出 KV 缓存编辑原语,直接解决 Agent 动态对话中的记忆管理与更新问题。

研究机构
Erlangen National High Performance Computing Center
论文信息
作者 Bole Ma, Jan Eitzinger, Harald Koestler
发布日期 2026-05-31
arXiv ID 2606.01065
相关性评分 9/10 (高度相关)