causal reasoning model interpretability benchmark evaluation hidden state analysis
摘要

本文发现大语言模型在因果问题上的内部编码与实际回答存在错位。在反常识因果基准测试中,线性探针能从隐藏状态高准确率恢复证据支持的答案,而口头的是/否回答却退化为常识性错误。这种约 0.5 的差距被称为“因果失语”,揭示了两种独立的失败模式:缺乏内部信号或信号无法通过语言接口表达。研究指出,仅凭输出准确率判断 LLM 是否具备因果推理能力存在局限,需重新审视相关基准测试的结论。

AI 推荐理由

论文核心探讨 LLM 因果推理中内部表征与输出不一致的机制,直接关联推理能力评估。

研究机构
深圳中学国际部, 深圳大学
论文信息
作者 Ziyi Ding, Xiao-Ping Zhang
发布日期 2026-05-25
arXiv ID 2605.25891
相关性评分 9/10 (高度相关)