摘要
思维链(CoT)推理提升了大语言模型的解决问题的能力,但生成的推理轨迹可能无法真实反映模型的实际决策过程。现有检测方法主要依赖外部信号,忽视了内部计算证据。针对完整推理电路构建成本高且难以扩展的问题,本文提出电路引导的内外部差异评分器(CIE-Scorer)。该框架基于忠实推理应与计算过程对齐的假设,高效追踪紧凑的句子级电路,构建内外部推理图,并利用融合 Gromov-Wasserstein 距离衡量其差异。实验表明,该方法在降低电路构建成本的同时,实现了最先进的检测性能。
AI 推荐理由
论文核心研究思维链(CoT)的忠实性检测机制,直接针对推理过程的可解释性与真实性。
研究机构
University of Central Florida
Arizona State University
University of Vienna
论文信息