Red Teaming Reinforcement Learning Co-training GRPO AI Safety
摘要

AI 红队测试需持续适应不断演变的攻击者与防御者。强化学习是发现新型攻击的有效途径,而共训练方法可协同生成更鲁棒的防御者。针对现有研究指出 GRPO 在此场景下不稳定的问题,本文提出 AdvGRPO 框架,利用密集多通道奖励和解耦优势归一化,使 GRPO 适用于联合攻防优化。训练采用课程学习策略,从单轮攻击过渡到闭环多轮攻击,进而引导交替更新的共训练过程。实验表明,该方法能生成高效且可迁移的攻击,共训练出的防御者在安全基准上优于基线模型。

AI 推荐理由

论文核心在于通过对抗共训练实现攻击者与防御者的自适应进化与自我改进。

研究机构
Microsoft AI Red Team Microsoft Azure
论文信息
作者 Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich
发布日期 2026-06-08
arXiv ID 2606.09701
相关性评分 9/10 (高度相关)