commonsense reasoning causal inference dataset KGQA evaluation benchmark
摘要

为有效与现实世界交互,大语言模型需具备基于实体的常识推理能力,即整合特定实体事实知识与常识推断。现有数据集多关注真假判断或选择题,缺乏对模型因果溯因及解释生成能力的显式评估。本文提出 CommonWhy 数据集,包含 15,000 个“为什么”问题,旨在评估 LLM 在因果关系上的实体常识推理。该数据集亦作为知识图谱问答基准,其所需支持知识均源自 Wikidata。不同于主要测试事实检索的现有数据集,CommonWhy 专注于因果常识推理,确立了 KGQA 评估新范式。实验表明,当前先进模型在此任务中存在严重的事实幻觉与因果推理失败。

AI 推荐理由

论文核心聚焦于评估 LLM 的实体因果常识推理与溯因能力,直接针对推理机制。

研究机构
University of Toronto Toronto, ON, Canada
论文信息
作者 Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner
发布日期 2026-05-13
arXiv ID 2605.12918
相关性评分 9/10 (高度相关)