摘要
大型推理模型(LRM)暴露思维链虽提升了透明度,却引发了推理轨迹中隐藏有害内容的安全盲区。本文评估了最终答案安全性是否足以代表完整推理路径,发现存在“泄露”与“逃逸”两类高风险案例。研究提出一种白盒测试时缓解方法——自适应多原则引导,通过学习不安全到安全的激活方向并动态干预,显著降低了推理轨迹和最终答案中的不安全内容。实验表明,该方法在保持高准确率的同时,平均减少了 40.8% 的不安全输出,证明需对完整推理 - 回答轨迹进行安全评估与治理。
AI 推荐理由
论文核心研究大型推理模型(LRM)的思维链安全失效及缓解,直接针对推理过程。
研究机构
哈佛大学
南加利福尼亚大学
布朗大学
宾夕法尼亚州立大学
得克萨斯A&M大学
普渡大学
论文信息