摘要
为有效与现实世界交互,大语言模型需具备基于实体的常识推理能力,即整合特定实体事实知识与常识推断。现有数据集多关注真假判断或选择题,缺乏对模型因果溯因及解释生成能力的显式评估。本文提出 CommonWhy 数据集,包含 15,000 个“为什么”问题,旨在评估 LLM 在因果关系上的实体常识推理。该数据集亦作为知识图谱问答基准,其所需支持知识均源自 Wikidata。不同于主要测试事实检索的现有数据集,CommonWhy 专注于因果常识推理,确立了 KGQA 评估新范式。实验表明,当前先进模型在此任务中存在严重的事实幻觉与因果推理失败。
AI 推荐理由
论文核心聚焦于评估 LLM 的实体因果常识推理与溯因能力,直接针对推理机制。
研究机构
University of Toronto
Toronto, ON, Canada
论文信息