摘要
本文提出 CausaLab,一个用于评估大语言模型代理交互式因果发现的可扩展环境。该环境不仅评估代理利用因果证据解决问题的能力,还检验其答案是否基于正确的底层因果机制假设。实验表明,当前代理在预测准确性与结构恢复之间存在显著差距,混合观察 - 干预策略能提升结构保真度,但纯干预策略表现不佳。研究还发现代理存在过早停止的问题,并通过一致性验证缓解。CausaLab 有效分离了预测成功与因果理解,揭示了现有代理作为实验因果推理者的局限性。
AI 推荐理由
论文核心评估 LLM 代理的因果推理能力,区分预测成功与机制理解,属推理研究。
研究机构
清华大学
伊利诺伊大学香槟分校
卡内基梅隆大学
芝加哥大学
Adobe
论文信息