Chain-of-Thought Mechanistic Interpretability Decision Making Activation Steering
摘要

本文探讨大型语言推理模型在做出选择时,是“先思后决”还是“先决后思”。研究发现,可检测的早期编码决策塑造了思维链过程。具体而言,简单的线性探针能以高置信度从生成前激活中解码工具调用决策,甚至在产生任何推理令牌之前。激活操控进一步证实了因果关系:扰动决策方向会导致过度深思或在多数案例中翻转行为。行为分析显示,当操控改变决策时,思维链过程往往是对这一翻转进行合理化,而非抵制。结果表明,推理模型可能在开始文本深思前已编码了行动选择。

AI 推荐理由

核心研究思维链中决策与推理的因果时序,揭示先决策后推理机制。

研究机构
Khoury College of Computer Sciences, Northeastern University Mila, ServiceNow Research ServiceNow
论文信息
作者 Esakkivel Esakkiraja, Sai Rajeswar, Denis Akhiyarov, Rajagopal Venkatesaramani
发布日期 2026-04-01
arXiv ID 2604.01202
相关性评分 9/10 (高度相关)