Chain-of-Thought Mechanistic Interpretability Unfaithfulness Detection Circuit Tracing
摘要

思维链(CoT)推理提升了大语言模型的解决问题的能力,但生成的推理轨迹可能无法真实反映模型的实际决策过程。现有检测方法主要依赖外部信号,忽视了内部计算证据。针对完整推理电路构建成本高且难以扩展的问题,本文提出电路引导的内外部差异评分器(CIE-Scorer)。该框架基于忠实推理应与计算过程对齐的假设,高效追踪紧凑的句子级电路,构建内外部推理图,并利用融合 Gromov-Wasserstein 距离衡量其差异。实验表明,该方法在降低电路构建成本的同时,实现了最先进的检测性能。

AI 推荐理由

论文核心研究思维链(CoT)的忠实性检测机制,直接针对推理过程的可解释性与真实性。

研究机构
University of Central Florida Arizona State University University of Vienna
论文信息
作者 Xu Shen, Zhen Tan, Song Wang, Pingjun Hong, Rui Miao et al.
发布日期 2026-05-25
arXiv ID 2605.25603
相关性评分 9/10 (高度相关)