摘要
针对现有防御难以应对自适应黑盒攻击的问题,本文提出 CHASE 框架,构建黑盒攻击者与安全防御者共进化的闭环红蓝对抗系统。攻击者基于组相对策略优化(GRPO)训练以最大化绕过效果,防御者则利用生成的对抗样本进行两阶段强化学习与监督微调。实验表明,该方法显著降低攻击成功率且无误拒,证明了无模板强化学习探索能恢复潜在的通用攻击原语,为提升大模型安全泛化能力提供了新路径。
AI 推荐理由
论文提出红蓝对抗共进化框架,核心机制是攻击者与防御者的协同自我进化与改进。
研究机构
University of New South Wales, Australia
论文信息