摘要
本文揭示了推理模型中存在的“表演性思维链”现象,即模型虽已确信最终答案,仍继续生成令牌而不显露内部信念。通过在 DeepSeek-R1 和 GPT-OSS 上的激活探测与强制早停实验,发现简单任务中答案可更早从激活中解码,而困难任务则体现真实推理。尽管存在表演成分,但回溯等转折点仍对应真实的信念波动。基于探针引导的早期退出策略在保持准确率的同时,显著减少了令牌消耗,为检测表演性推理及实现自适应计算提供了高效工具。
AI 推荐理由
核心研究思维链(CoT)机制,揭示表演性推理与真实信念的差异,提出基于探针的早期退出方法。
研究机构
Equal contribution
Cambridge, MA
Harvard University, Cambridge, MA
Correspondence to: Siddharth Boppana
Annabel Ma
论文信息