Safety Alignment Chain-of-Thought DPO Jailbreak Defense Reasoning
摘要

针对现有大语言模型在面对伪装有害意图的越狱攻击时表现脆弱的问题,本文指出其根源在于缺乏深度推理的浅层对齐机制。为此,作者提出通过推理感知的后训练增强对齐效果:首先构建包含逐步推理理由的新型思维链微调数据集,促使模型生成基于原则的拒绝回复;其次,引入对齐加权直接偏好优化(Alignment-Weighted DPO),通过对推理过程与最终答案分配不同偏好权重,实现更细粒度的针对性更新。实验表明,该方法在显著提升对抗多样越狱策略鲁棒性的同时,保持了模型的整体效用。

AI 推荐理由

论文核心提出基于推理的对齐方法,利用思维链和加权机制提升模型安全推理能力。

研究机构
弗吉尼亚大学 Capital One
论文信息
作者 Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li et al.
发布日期 2026-02-24
arXiv ID 2602.21346
相关性评分 9/10 (高度相关)