LLM Safety Red-Blue Teaming Reinforcement Learning Adversarial Attack Co-evolution
摘要

针对现有防御难以应对自适应黑盒攻击的问题,本文提出 CHASE 框架,构建黑盒攻击者与安全防御者共进化的闭环红蓝对抗系统。攻击者基于组相对策略优化(GRPO)训练以最大化绕过效果,防御者则利用生成的对抗样本进行两阶段强化学习与监督微调。实验表明,该方法显著降低攻击成功率且无误拒,证明了无模板强化学习探索能恢复潜在的通用攻击原语,为提升大模型安全泛化能力提供了新路径。

AI 推荐理由

论文提出红蓝对抗共进化框架,核心机制是攻击者与防御者的协同自我进化与改进。

研究机构
University of New South Wales, Australia
论文信息
作者 Rahul Markasserithodi, Aditya Joshi, Yuekang Li, Ishmanbir Singh, Chris Yoo et al.
发布日期 2026-06-04
arXiv ID 2606.05523
相关性评分 9/10 (高度相关)