Chain-of-Thought Interpretability Knowledge Conflict Faithfulness LLM Evaluation
摘要

当语言模型面对与训练知识相矛盾的文档时,需决定遵循文档还是信任自身。本研究探讨模型的思维链(CoT)推理是否忠实报告了这一决策机制。通过引入“内省忠实性”概念,在 200 个问题、8 个模型及 4 种提示条件下进行测试。研究发现,CoT 推理在不同决策间高度稳定,即使结论翻转,其相似度仍高达 96%。然而,自评置信度携带了微弱的真实信号,尤其在实体知名度无信息量时能预测决策。仅 GPT-4o 表现出统计上可靠的推理 - 决策耦合。内部思考令牌比用户可见的 CoT 具有更高的决策敏感性。结论表明,CoT 主要由决策无关的知识展示构成,仅包含微弱的置信度信号;监控时应关注置信度而非论证过程。

AI 推荐理由

论文核心研究思维链(CoT)在知识冲突下的忠实性与可解释性,直接探讨推理机制。

研究机构
Independent Researcher
论文信息
作者 Pruthvinath Jeripity Venkata
发布日期 2026-05-26
arXiv ID 2605.27773
相关性评分 9/10 (高度相关)