jailbreak red-teaming evolutionary search multi-turn dialogue LLM safety
摘要

大型语言模型易受越狱攻击,现有自动化红队多局限于单轮静态提示。本文提出 ContextualJailbreak,一种在黑盒设置下对模拟多轮对话进行进化搜索的策略。该方法利用分级伤害评分作为反馈信号,驱动五种语义变异算子(含两种新颖算子)迭代优化攻击提示。实验表明,该策略在多个开源模型上实现极高攻击成功率,显著优于基线方法,且发现的攻击能有效迁移至部分闭源前沿模型,揭示了不同厂商模型在对齐鲁棒性上的显著差异。

AI 推荐理由

论文提出基于进化搜索的红队策略,核心机制为自我迭代与变异算子优化攻击。

研究机构
Universidad de Murcia, Spain IBM Research, Ireland
论文信息
作者 Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin, Jose L. Hernández-Ramos
发布日期 2026-05-04
arXiv ID 2605.02647
相关性评分 9/10 (高度相关)