摘要
大语言模型在因果推理基准测试中准确率可达 50% 至 70%,但其究竟是基于结构化推理还是词汇模式匹配尚不明确。本文提出 Caliper 方法,通过用占位符替换语义变量名,同时保留因果图和概率规范,对模型进行受控扰动测试。实验涵盖九种指令微调模型及三个基准,结果显示去除词汇锚点后准确率显著下降,表明当前模型在零样本设置下缺乏真正的结构因果推理能力,主要依赖表面词汇线索。
AI 推荐理由
论文核心探究 LLM 是否具备真正的因果结构推理能力,而非词汇匹配。
研究机构
复旦大学
论文信息