摘要
显式思维链虽赋能大型推理模型,却易生成高风险答案。现有对齐范式多依赖外部强制合规,缺乏内在安全理解。本文提出 Safety Internal 框架,仅通过安全验证任务训练模型,利用专家推理轨迹批判自身输出,从而内化安全规范。研究表明,学习验证能显著提升对域外越狱攻击的鲁棒性。结合强化学习时,该方法比标准监督微调提供更优初始化,证明内化安全理解比单纯模仿安全行为更能奠定坚实的对齐基础。
AI 推荐理由
论文聚焦大型推理模型,利用专家推理轨迹进行安全验证,核心在于提升模型的内在推理与自我评估能力。
研究机构
University of Science and Technology of China
National University of Singapore
论文信息