摘要
大型推理模型(LRMs)在输出前生成思维链(CoT),引入了可能复杂化控制机制的动态内部状态。与指令微调模型不同,LRMs 的拒绝行为不仅依赖单一方向子空间,还取决于 CoT。实验表明,固定 CoT 时激活引导仅能逆转 39% 的拒绝,而移除 CoT 后该比例升至 70%,证明 CoT 主动强化了拒绝。若让模型在引导下重生成 CoT,拒绝逆转率达 94%,且新生成的 CoT 独立保留了部分合规信号。这表明 LRMs 的拒绝由残差流激活与 CoT 共同编码,虽增强了对激活级干预的鲁棒性,但也使 CoT 暴露于表面攻击风险。
AI 推荐理由
论文核心研究思维链(CoT)在大型推理模型中对拒绝机制的动态影响及内部编码方式。
研究机构
University of Göttingen, Germany
论文信息