Self-Evolving Red Teaming Agent Security Adaptive Attack
摘要

针对代理技能部署风险,本文提出“自适应泄漏”概念,即攻击者利用审计与运行时反馈迭代重写技能以通过审查并造成危害。为此,我们设计了 Proteus,一个灰盒自我进化红队框架。该框架在五维攻击空间中搜索,通过统一管道获取结构化反馈指导跨轮次变异,并执行路径与表面扩展以发现替代实现及迁移攻击模式。实验表明,Proteus 在多轮迭代后攻击成功率显著,揭示当前技能审查严重低估了自适应攻击者的残留风险。

AI 推荐理由

论文核心提出自我进化红队框架,利用反馈迭代重写技能以绕过审计,聚焦自适应攻击机制。

研究机构
上海交通大学计算机科学与工程系
论文信息
作者 Zhaojiacheng Zhou
发布日期 2026-05-12
arXiv ID 2605.11891
相关性评分 9/10 (高度相关)