摘要
本文提出 CRAFT,一种利用模型推理能力和隐藏表征的红队对抗对齐框架,旨在提升针对越狱攻击的鲁棒性。与主要在输出层操作的防御不同,CRAFT 通过在隐藏状态空间显式优化目标,对齐大型推理模型以生成具备安全意识的推理轨迹。该方法结合了对比表征学习与强化学习,分离安全与不安全的推理路径,构建支持鲁棒推理级安全对齐的潜在空间几何结构。实验表明,CRAFT 在多个安全基准上显著优于现有防御方法。
AI 推荐理由
论文核心在于利用隐藏表征对齐推理轨迹,直接优化模型的推理过程以提升安全性。
研究机构
西北大学计算机科学与工程系,美国伊利诺伊州埃文斯顿,邮编60208
密歇根大学安娜堡分校计算机科学与工程系,美国密歇根州安娜堡,邮编48109
伊利诺伊理工大学计算机科学系,美国芝加哥,邮编60616
论文信息