LoRA KV Cache Compression Parametric Memory RAG
摘要

参数化检索增强将文档信息编码为轻量级模块(如 LoRA 适配器),以减少输入上下文需求。本文研究了文档级问答中参数侧记忆与 KV 缓存中上下文侧记忆的交互。研究发现,当 KV 缓存完整时 LoRA 贡献有限,但在激进压缩下效用显著,尤其在无文档上下文时恢复大量性能。结果表明,文档 LoRA 更应被视为解码时的参数化记忆而非文档编码器,且 QA 式监督优于原始上下文预测。该研究确立了文档 LoRA 作为互补记忆通道的地位,其价值在上下文证据稀缺时尤为凸显。

AI 推荐理由

论文核心研究参数化记忆(LoRA)与上下文记忆(KV Cache)的交互机制及压缩场景下的互补性。

研究机构
Johns Hopkins University
论文信息
作者 Chunsheng Zuo, Liaoyaqi Wang, William Jurayj, William Fleshman, Benjamin Van Durme
发布日期 2026-06-04
arXiv ID 2606.05698
相关性评分 9/10 (高度相关)