思维链 隐写术 推理安全 对抗攻击
摘要

语言模型生成的思维链(CoT)虽驱动其能力,但也可能被用于 covertly 传递信息。现有隐写方案多基于词符空间,易被重述防御破解。本文提出“概念隐写术”,利用高层推理行为模式而非词汇选择在 CoT 步骤中编码信息。实验表明,该方法在多种模型和推理领域均比传统关键词方法更能抵抗强重述防御,且不影响推理效用。文章进一步证明,策略感知型重述器可有效阻断该信道,为保障真实场景下的 LLM 推理可靠性提供了新挑战与防御建议。

AI 推荐理由

论文核心研究思维链(CoT)中的信息隐藏机制,直接涉及推理过程的内部表征与安全性。

研究机构
南加利福尼亚大学信息科学研究所
论文信息
作者 Zhejian Zhou, Jonathan May
发布日期 2026-05-26
arXiv ID 2605.26537
相关性评分 9/10 (高度相关)