摘要
当语言模型面对与训练知识相矛盾的文档时,需决定遵循文档还是信任自身。本研究探讨模型的思维链(CoT)推理是否忠实报告了这一决策机制。通过引入“内省忠实性”概念,在 200 个问题、8 个模型及 4 种提示条件下进行测试。研究发现,CoT 推理在不同决策间高度稳定,即使结论翻转,其相似度仍高达 96%。然而,自评置信度携带了微弱的真实信号,尤其在实体知名度无信息量时能预测决策。仅 GPT-4o 表现出统计上可靠的推理 - 决策耦合。内部思考令牌比用户可见的 CoT 具有更高的决策敏感性。结论表明,CoT 主要由决策无关的知识展示构成,仅包含微弱的置信度信号;监控时应关注置信度而非论证过程。
AI 推荐理由
论文核心研究思维链(CoT)在知识冲突下的忠实性与可解释性,直接探讨推理机制。
研究机构
Independent Researcher
论文信息