LLM Safety Co-Evolution Memory Retrieval Red Teaming Model-Agnostic
摘要

针对大语言模型易受对抗提示攻击的问题,现有安全范式存在攻击发现饱和及防御僵化等局限。本文提出 EvoSafety 框架,构建持久且可复用的外部结构。在红队测试中,利用对抗技能库支持攻击向量的持续进化;在防御学习中,采用增强记忆检索的轻量级辅助模型替代特定模型的微调,仅通过记忆更新即可提升鲁棒性并实现跨模型迁移。实验表明,该框架在防护模式下防御成功率达 99.61%,显著优于同类模型,同时保持了良好的推理性能。

AI 推荐理由

论文提出攻击 - 防御协同进化框架,核心机制在于持续的技能库扩展与记忆更新驱动的自适应安全。

研究机构
City University of Hong Kong
论文信息
作者 Xiaozhe Zhang, Chaozhuo Li, Hui Liu, Shaocheng Yan, Bingyu Yan et al.
发布日期 2026-05-13
arXiv ID 2605.13411
相关性评分 9/10 (高度相关)