Backdoor Attacks Continuous Reasoning Mechanistic Interpretability LLM Security
摘要

本文揭示了完全在连续隐藏状态中推理的新型语言模型面临的全新攻击面。提出的 ThoughtSteer 方法通过扰动输入层单个嵌入向量,利用模型多步推理放大扰动,劫持潜在轨迹以输出攻击者指定答案,且对令牌级防御不可见。实验表明该方法在多种架构和基准上攻击成功率超 99%,能逃避现有防御并抵抗微调。研究进一步发现神经坍缩机制导致防御失效,而对抗信息编码于集体轨迹而非单一向量中,为连续推理的可解释性提供了新视角。

AI 推荐理由

论文核心研究连续隐状态推理机制及其安全漏洞,直接针对推理过程。

研究机构
Intuit
论文信息
作者 Swapnil Parekh
发布日期 2026-04-01
arXiv ID 2604.00770
相关性评分 9/10 (高度相关)