causal reasoning lexical anchoring LLM evaluation
摘要

大语言模型在因果推理基准测试中准确率可达 50% 至 70%,但其究竟是基于结构化推理还是词汇模式匹配尚不明确。本文提出 Caliper 方法,通过用占位符替换语义变量名,同时保留因果图和概率规范,对模型进行受控扰动测试。实验涵盖九种指令微调模型及三个基准,结果显示去除词汇锚点后准确率显著下降,表明当前模型在零样本设置下缺乏真正的结构因果推理能力,主要依赖表面词汇线索。

AI 推荐理由

论文核心探究 LLM 是否具备真正的因果结构推理能力,而非词汇匹配。

研究机构
复旦大学
论文信息
作者 Zhenyu Yu, Shuigeng Zhou
发布日期 2026-06-03
arXiv ID 2606.04915
相关性评分 9/10 (高度相关)