Memory Security Anomaly Detection Retrieval-Augmented Generation Adversarial Attacks
摘要

本文形式化了检索增强代理的记忆投毒攻击,并指出现有评估协议的不一致性。主要贡献是提出 MEMSAD,一种基于校准的防御机制,利用梯度耦合定理证明异常分数梯度与检索目标梯度一致,从而提供认证检测半径。理论证明了其极小极大最优性及在线遗憾界,并揭示了离散同义词替换的攻击漏洞。实验表明,该复合防御在所有攻击下实现了完美的真阳性率和零假阳性率,但无法防御同义词替换攻击。

AI 推荐理由

论文核心研究检索增强代理的外部记忆机制安全性,提出针对记忆投毒的检测防御方法。

研究机构
Department of Electrical Engineering and Computer Sciences, University of California, Berkeley
论文信息
作者 Ishrith Gowda
发布日期 2026-05-05
arXiv ID 2605.03482
相关性评分 9/10 (高度相关)