Large Reasoning Models Safety Alignment Chain-of-Thought Adaptive Steering LLM Safety
摘要

大型推理模型(LRM)暴露思维链虽提升了透明度,却引发了推理轨迹中隐藏有害内容的安全盲区。本文评估了最终答案安全性是否足以代表完整推理路径,发现存在“泄露”与“逃逸”两类高风险案例。研究提出一种白盒测试时缓解方法——自适应多原则引导,通过学习不安全到安全的激活方向并动态干预,显著降低了推理轨迹和最终答案中的不安全内容。实验表明,该方法在保持高准确率的同时,平均减少了 40.8% 的不安全输出,证明需对完整推理 - 回答轨迹进行安全评估与治理。

AI 推荐理由

论文核心研究大型推理模型(LRM)的思维链安全失效及缓解,直接针对推理过程。

研究机构
哈佛大学 南加利福尼亚大学 布朗大学 宾夕法尼亚州立大学 得克萨斯A&M大学 普渡大学
论文信息
作者 Xiaomin Li, Jianheng Hou, Zheyuan Deng, Zhiwei Zhang, Taoran Li et al.
发布日期 2026-05-07
arXiv ID 2605.05678
相关性评分 9/10 (高度相关)