Backdoor Attacks Chain-of-Thought LLM Security Critical Thinking Robustness
摘要

大语言模型虽能力卓越,但易受后门攻击。现有攻击多基于令牌级别,而最新研究利用长文本推理倾向实施推理级后门,诱导模型在思维链中插入恶意步骤,极具隐蔽性。为此,本文提出 Critical-CoT,一种通过两阶段微调赋予模型批判性思维行为的新型防御机制,使其能自动识别并拒绝生成恶意推理步骤。实验表明,该方法在多种模型和数据集上对各类后门攻击均表现出强大的鲁棒性及跨域泛化能力。

AI 推荐理由

论文针对推理级后门攻击,通过培养批判性思维行为来防御恶意推理步骤,核心聚焦于推理过程的安全与鲁棒性。

研究机构
INRS, University of Quebec
论文信息
作者 Vu Tuan Truong, Long Bao Le
发布日期 2026-04-12
arXiv ID 2604.10681
相关性评分 9/10 (高度相关)