LLM Safety Memory Architecture Jailbreak Defense Self-Evolving Agent Security
摘要

尽管安全对齐取得进展,大语言模型仍易受不断演变的越狱攻击。现有分类器难以适应新攻击,而基于记忆的防御常过度拒绝良性请求。本文提出 Membrane,一种基于对比安全记忆(CSM)的自进化防御机制。它将有害查询与表面相似的良性请求配对存储,无需重训练即可通过蒸馏交互数据进化记忆单元。实验表明,该方法在多种攻击下 F1 值最高,且良性拒绝率显著低于现有方法,具备强大的跨攻击迁移能力和抗毒性。

AI 推荐理由

论文提出基于对比安全记忆的自进化防御机制,核心在于记忆架构设计与更新。

研究机构
KAIST AI Financial Tech Lab, KakaoBank Corp
论文信息
作者 Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son et al.
发布日期 2026-06-04
arXiv ID 2606.05743
相关性评分 9/10 (高度相关)