摘要
尽管事实验证进展迅速,但我们缺乏对这些基准测试实际考察何种推理的系统理解。本文利用 GPT-4o-mini 为九个数据集的 2.4 万个样本生成结构化推理轨迹,发现直接证据提取占主导,而多句综合与数值推理严重不足。数据集层面存在显著偏差:部分仅测试词汇匹配,部分则需信息综合。通过小型验证器刻画了五类错误,显示错误分布因领域而异。结果表明高分主要反映检索加蕴含能力,并提出了构建更具挑战性评估套件的建议。
AI 推荐理由
论文核心在于分析事实验证数据集中的推理类型分布及模型推理错误模式。
研究机构
University of Pennsylvania, Philadelphia, PA, USA
论文信息