Chain-of-Thought Interpretability Activation Steering Faithfulness
摘要

随着思维链(CoT)成为提升大语言模型推理能力的关键,其作为可解释性工具的价值日益凸显。然而,这取决于 CoT 是否忠实反映底层决策过程。本文提供机械证据表明,指令微调模型通常在生成 CoT 前已确定答案。通过在 CoT 前的最后一个 token 处训练线性探针,能以 0.9 的 AUC 预测最终答案。激活转向实验进一步证实了因果性:沿探针方向引导激活可在超 50% 的情况下翻转答案。当引导导致错误时,观察到非蕴含和虚构两种失败模式,表明基于错误信念的事后推理可能导致不良行为。

AI 推荐理由

论文深入探究思维链(CoT)的忠实性机制,揭示模型在推理前已确定答案,属推理核心研究。

研究机构
独立作者(CBAIL)
论文信息
作者 Kyle Cox, Darius Kianersi, Adrià Garriga-Alonso
发布日期 2026-03-02
arXiv ID 2603.01437
相关性评分 9/10 (高度相关)