摘要
大型推理模型(LRMs)虽展现出卓越的推理能力,但其显式的思维链(CoT)机制引入了新的安全风险,使其易受越狱攻击。现有方法多依赖静态 CoT 模板,缺乏多样性与适应性。为此,本文提出自适应进化 CoT 越狱框架(AE-CoT)。该方法首先将有害目标重写为温和提示并分解为语义连贯的推理片段,构建候选池;随后在结构化表示空间中进行多代进化搜索,通过片段级交叉和自适应变异策略扩展多样性;最后利用独立评分模型评估危害性,并增强高分候选以诱导破坏性生成。实验表明,AE-CoT 在多个模型和数据集上均优于现有最先进方法。
AI 推荐理由
论文核心研究思维链(CoT)机制的安全漏洞,提出基于进化搜索的自适应 CoT 攻击方法。
研究机构
Northeastern University
Hong Kong, China
Hubei Key Laboratory of Data Science and Knowledge Management
Nanyang Technological University
Singapore
The Hong Kong Polytechnic University
Zhejiang University
China
Renmin University of China
Beijing, China
DynaHex Technology
Sun Yat-sen University
Guangdong, China
论文信息