Adversarial Attack Autonomous Research Self-Evolution LLM Safety Red Teaming
摘要

本文展示了基于 Claude Code 的“自动研究”流水线能够发现新型白盒对抗攻击算法,其越狱和提示注入效果显著优于现有三十多种方法。该智能体从现有攻击实现出发进行迭代优化,在特定查询上攻击成功率高达 40%,远超基线的 10%。发现的算法具备泛化性,可直接迁移至未见模型,对 Meta-SecAlign-70B 实现 100% 攻击成功率。研究表明,利用大语言模型智能体自动化增量安全与安保研究是可行的,尤其适用于白盒对抗红队测试。

AI 推荐理由

论文核心展示 Agent 通过迭代自我改进发现新算法,显著超越现有方法,体现自我进化能力。

研究机构
MATS ELLS Institute Tübingen & Max Planck Institute for Intelligent Systems Tübingen AI Center Imperial College London
论文信息
作者 Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping et al.
发布日期 2026-03-25
arXiv ID 2603.24511
相关性评分 9/10 (高度相关)