Chain-of-Thought Interpretability Reasoning Mechanism Hallucination
摘要

本文挑战了思维链(CoT)轨迹与决定答案的计算过程保持同步的假设。通过构建步级检测框架并结合多种探测技术,在九个模型和七个基准测试中发现,潜在承诺与显式答案到达的平均对齐率仅为 61.9%。主要失配模式为“虚构延续”,即答案确定后仍生成看似深思熟虑但无实质影响的文本。研究表明,CoT 虽能提升性能,但其轨迹并非答案形成时间的可靠报告,且效用越高的场景往往时间忠实度越低。

AI 推荐理由

论文核心研究思维链(CoT)推理过程的内部机制、真实性及与最终答案的同步性。

研究机构
Carnegie Mellon University Fujitsu Research of America Inc.
论文信息
作者 Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue
发布日期 2026-05-12
arXiv ID 2605.11746
相关性评分 9/10 (高度相关)