Chain-of-Thought LLM Safety Jailbreak Defense Reasoning Calibration
摘要

大型语言模型在复杂推理任务中表现卓越,但极易受到破坏安全对齐的越狱攻击。现有防御机制通常仅对最终输出进行事后过滤,导致中间推理步骤缺乏监控且易受对抗性操纵。为此,本文提出更安全思维链(SFCoT)框架,旨在实时主动评估并校准潜在的不安全推理步骤。SFCoT 结合三级安全评分系统与多视角一致性验证机制,以检测推理全过程中的潜在风险,并通过动态干预模块进行针对性校准,将推理轨迹引导至安全结果。实验表明,该方法将攻击成功率从 58.97% 降至 12.31%,是一种有效且高效的 LLM 安全增强方法,且未显著降低通用性能。

AI 推荐理由

论文核心提出安全思维链框架,直接针对推理过程进行实时评估与校准,属推理机制研究。

研究机构
天津大学管理与经济学部 NSFOCUS Technologies Group Co., Ltd. 天津大学网络空间安全学院
论文信息
作者 Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si et al.
发布日期 2026-03-16
arXiv ID 2603.15397
相关性评分 9/10 (高度相关)