Causal Inference Benchmark Multi-Agent System Social Science
摘要

社会科学中的因果推断依赖于基于现实政策干预的端到端、以干预为中心的研究设计推理,但现有基准未能评估大语言模型(LLM)的这一能力。本文提出 InterveneBench,旨在评估模型在真实社会场景下的此类推理能力。该基准包含 744 项同行评审研究,要求模型在无预定义因果图或结构方程的情况下,对政策干预及识别假设进行推理。实验表明最先进 LLM 在此设定下表现不佳。为此,我们提出了多智能体框架 STRIDES,显著提升了推理性能。

AI 推荐理由

论文核心评估并提升 LLM 在因果推断与干预设计中的推理能力,提出多智能体框架解决该难题。

研究机构
复旦大学 上海人工智能实验室 上海人工智能 Laboratory
论文信息
作者 Shaojie Shi, Zhengyu Shi, Lingran Zheng, Xinyu Su, Anna Xie et al.
发布日期 2026-03-16
arXiv ID 2603.15542
相关性评分 9/10 (高度相关)