摘要
现有因果推断基准常将因果识别(研究设计)与估计(数值计算)混为一谈。本文提出 CausalReasoningBenchmark,包含来自真实数据集的 173 个查询,要求系统分别输出结构化识别规范和数值估计。通过独立评分,该基准能细粒度诊断模型是在因果推理还是数值执行上失败。实验表明,当前最先进 LLM 虽能识别高层策略,但在具体研究设计的细节规范上表现不佳,揭示了因果推理能力的瓶颈所在。
AI 推荐理由
论文核心评估 LLM 的因果识别与推理能力,区分逻辑设计与数值计算错误。
研究机构
斯坦福大学
论文信息