摘要
大型推理模型(LRMs)虽通过思维链(CoT)显著提升性能,但近期研究表明其推理能力的增强是以安全性大幅退化为代价的。本文揭示 LRMs 的安全性退化仅在启用 CoT 后发生。为此,我们提出一种新颖的安全对齐方法,旨在促使 LRMs 在生成 CoT 之前先做出安全决策。具体而言,该方法利用基于 Bert 的分类器从安全模型中提取安全决策信号,并将其作为辅助监督整合到 LRMs 的对齐过程中。实验表明,该方法在有效保持 LRMs 通用推理性能的同时,显著提升了其安全能力。
AI 推荐理由
论文核心研究思维链(CoT)生成对大型推理模型安全性的影响及改进机制。
研究机构
东南大学, 中国
昆士兰大学, 澳大利亚
论文信息