Jailbreaking Self-Evolution Rule-Based Memory Mechanism Safety Alignment
摘要

针对现有自动越狱方法缺乏对成功与失败经验的系统利用及可复用规则组合机制的问题,本文提出一种自我进化的基于规则的无训练越狱框架(SRTJ)。该方法无需更新模型参数,通过交互反馈系统地发现、组合并细化攻击策略。SRTJ 结合经验驱动的攻击生成与基于答案集编程的规则选择,利用验证器反馈迭代优化策略并分析失败模式。其构建的分层规则记忆机制将攻击知识组织为长、中、短期规则,有效平衡探索与利用,在多个基准测试中展现出优异的鲁棒性与泛化能力。

AI 推荐理由

论文提出自我进化框架,通过反馈迭代优化攻击规则,核心机制为自我改进与适应。

研究机构
HKUST (GZ) Jilin University Yale University
论文信息
作者 Jindong Li, Ying Liu, Yali Fu, Jinjing Zhu, Leyao Wang et al.
发布日期 2026-05-01
arXiv ID 2605.00974
相关性评分 9/10 (高度相关)