Large Reasoning Models Safety Alignment Chain-of-Thought Decision Making
摘要

大型推理模型(LRMs)虽通过思维链(CoT)显著提升性能,但近期研究表明其推理能力的增强是以安全性大幅退化为代价的。本文揭示 LRMs 的安全性退化仅在启用 CoT 后发生。为此,我们提出一种新颖的安全对齐方法,旨在促使 LRMs 在生成 CoT 之前先做出安全决策。具体而言,该方法利用基于 Bert 的分类器从安全模型中提取安全决策信号,并将其作为辅助监督整合到 LRMs 的对齐过程中。实验表明,该方法在有效保持 LRMs 通用推理性能的同时,显著提升了其安全能力。

AI 推荐理由

论文核心研究思维链(CoT)生成对大型推理模型安全性的影响及改进机制。

研究机构
东南大学, 中国 昆士兰大学, 澳大利亚
论文信息
作者 Jianan Chen, Zhifang Zhang, Shuo He, Linan Yue, Lei Feng et al.
发布日期 2026-03-18
arXiv ID 2603.17368
相关性评分 9/10 (高度相关)