摘要
本文形式化了检索增强代理的记忆投毒攻击,并指出现有评估协议的不一致性。主要贡献是提出 MEMSAD,一种基于校准的防御机制,利用梯度耦合定理证明异常分数梯度与检索目标梯度一致,从而提供认证检测半径。理论证明了其极小极大最优性及在线遗憾界,并揭示了离散同义词替换的攻击漏洞。实验表明,该复合防御在所有攻击下实现了完美的真阳性率和零假阳性率,但无法防御同义词替换攻击。
AI 推荐理由
论文核心研究检索增强代理的外部记忆机制安全性,提出针对记忆投毒的检测防御方法。
研究机构
Department of Electrical Engineering and Computer Sciences, University of California, Berkeley
论文信息