摘要
本文展示了基于 Claude Code 的“自动研究”流水线能够发现新型白盒对抗攻击算法,其越狱和提示注入效果显著优于现有三十多种方法。该智能体从现有攻击实现出发进行迭代优化,在特定查询上攻击成功率高达 40%,远超基线的 10%。发现的算法具备泛化性,可直接迁移至未见模型,对 Meta-SecAlign-70B 实现 100% 攻击成功率。研究表明,利用大语言模型智能体自动化增量安全与安保研究是可行的,尤其适用于白盒对抗红队测试。
AI 推荐理由
论文核心展示 Agent 通过迭代自我改进发现新算法,显著超越现有方法,体现自我进化能力。
研究机构
MATS
ELLS Institute Tübingen & Max Planck Institute for Intelligent Systems
Tübingen AI Center
Imperial College London
论文信息