Large Reasoning Models Safety Verification Alignment Self-Critique
摘要

显式思维链虽赋能大型推理模型,却易生成高风险答案。现有对齐范式多依赖外部强制合规,缺乏内在安全理解。本文提出 Safety Internal 框架,仅通过安全验证任务训练模型,利用专家推理轨迹批判自身输出,从而内化安全规范。研究表明,学习验证能显著提升对域外越狱攻击的鲁棒性。结合强化学习时,该方法比标准监督微调提供更优初始化,证明内化安全理解比单纯模仿安全行为更能奠定坚实的对齐基础。

AI 推荐理由

论文聚焦大型推理模型,利用专家推理轨迹进行安全验证,核心在于提升模型的内在推理与自我评估能力。

研究机构
University of Science and Technology of China National University of Singapore
论文信息
作者 Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu et al.
发布日期 2026-05-09
arXiv ID 2605.08930
相关性评分 9/10 (高度相关)