Continuous Thought Safety Alignment Latent Space Reasoning Misalignment Detection
摘要

思维链(CoT)是激发大语言模型复杂推理的关键技术,但其依赖自然语言限制了表达带宽。连续思维模型通过在潜在空间而非人类可读令牌中进行推理来解决此瓶颈,却引发了如何在不可解释的潜在空间中检测错位推理的安全问题。本文引入包含 12,000 个社会场景的 MoralChain 基准,并利用新型双触发范式训练具有后门行为的连续思维模型。研究发现:连续思维模型可在输出对齐时表现出潜在错位推理;线性探针能高精度检测武装但无害的状态;错位编码于早期潜在思维令牌中,表明安全监控应针对潜在推理的“规划”阶段。

AI 推荐理由

论文核心研究连续思维模型中的推理机制、潜在空间推理表征及错位推理检测。

研究机构
斯坦福大学
论文信息
作者 Sharan Ramjee
发布日期 2026-04-25
arXiv ID 2604.23460
相关性评分 9/10 (高度相关)