Causal Discovery LLM Agents Scientific Reasoning Evaluation Benchmark
摘要

本文提出 CausaLab,一个用于评估大语言模型代理交互式因果发现的可扩展环境。该环境不仅评估代理利用因果证据解决问题的能力,还检验其答案是否基于正确的底层因果机制假设。实验表明,当前代理在预测准确性与结构恢复之间存在显著差距,混合观察 - 干预策略能提升结构保真度,但纯干预策略表现不佳。研究还发现代理存在过早停止的问题,并通过一致性验证缓解。CausaLab 有效分离了预测成功与因果理解,揭示了现有代理作为实验因果推理者的局限性。

AI 推荐理由

论文核心评估 LLM 代理的因果推理能力,区分预测成功与机制理解,属推理研究。

研究机构
清华大学 伊利诺伊大学香槟分校 卡内基梅隆大学 芝加哥大学 Adobe
论文信息
作者 Junlin Yang, Dylan Zhang, Xiangchen Song, Qirun Dai, Xiao Liu et al.
发布日期 2026-05-25
arXiv ID 2605.26029
相关性评分 9/10 (高度相关)