Chain-of-Thought Activation Steering Model Safety Large Reasoning Models
摘要

大型推理模型(LRMs)在输出前生成思维链(CoT),引入了可能复杂化控制机制的动态内部状态。与指令微调模型不同,LRMs 的拒绝行为不仅依赖单一方向子空间,还取决于 CoT。实验表明,固定 CoT 时激活引导仅能逆转 39% 的拒绝,而移除 CoT 后该比例升至 70%,证明 CoT 主动强化了拒绝。若让模型在引导下重生成 CoT,拒绝逆转率达 94%,且新生成的 CoT 独立保留了部分合规信号。这表明 LRMs 的拒绝由残差流激活与 CoT 共同编码,虽增强了对激活级干预的鲁棒性,但也使 CoT 暴露于表面攻击风险。

AI 推荐理由

论文核心研究思维链(CoT)在大型推理模型中对拒绝机制的动态影响及内部编码方式。

研究机构
University of Göttingen, Germany
论文信息
作者 Kia-Jüng Yang, Dominik Meier, Jiachen Zhao, Terry Ruas, Bela Gipp
发布日期 2026-05-26
arXiv ID 2605.26772
相关性评分 9/10 (高度相关)