摘要
本文发现大语言模型在因果问题上的内部编码与实际回答存在错位。在反常识因果基准测试中,线性探针能从隐藏状态高准确率恢复证据支持的答案,而口头的是/否回答却退化为常识性错误。这种约 0.5 的差距被称为“因果失语”,揭示了两种独立的失败模式:缺乏内部信号或信号无法通过语言接口表达。研究指出,仅凭输出准确率判断 LLM 是否具备因果推理能力存在局限,需重新审视相关基准测试的结论。
AI 推荐理由
论文核心探讨 LLM 因果推理中内部表征与输出不一致的机制,直接关联推理能力评估。
研究机构
深圳中学国际部, 深圳大学
论文信息