摘要
社会科学中的因果推断依赖于基于现实政策干预的端到端、以干预为中心的研究设计推理,但现有基准未能评估大语言模型(LLM)的这一能力。本文提出 InterveneBench,旨在评估模型在真实社会场景下的此类推理能力。该基准包含 744 项同行评审研究,要求模型在无预定义因果图或结构方程的情况下,对政策干预及识别假设进行推理。实验表明最先进 LLM 在此设定下表现不佳。为此,我们提出了多智能体框架 STRIDES,显著提升了推理性能。
AI 推荐理由
论文核心评估并提升 LLM 在因果推断与干预设计中的推理能力,提出多智能体框架解决该难题。
研究机构
复旦大学
上海人工智能实验室
上海人工智能 Laboratory
论文信息