Chain-of-Thought Interpretability Early Exit Activation Probing
摘要

本文揭示了推理模型中存在的“表演性思维链”现象,即模型虽已确信最终答案,仍继续生成令牌而不显露内部信念。通过在 DeepSeek-R1 和 GPT-OSS 上的激活探测与强制早停实验,发现简单任务中答案可更早从激活中解码,而困难任务则体现真实推理。尽管存在表演成分,但回溯等转折点仍对应真实的信念波动。基于探针引导的早期退出策略在保持准确率的同时,显著减少了令牌消耗,为检测表演性推理及实现自适应计算提供了高效工具。

AI 推荐理由

核心研究思维链(CoT)机制,揭示表演性推理与真实信念的差异,提出基于探针的早期退出方法。

研究机构
Equal contribution Cambridge, MA Harvard University, Cambridge, MA Correspondence to: Siddharth Boppana Annabel Ma
论文信息
作者 Siddharth Boppana, Annabel Ma, Max Loeffler, Raphael Sarfati, Eric Bigelow et al.
发布日期 2026-03-05
arXiv ID 2603.05488
相关性评分 9/10 (高度相关)