摘要
许多现实问题隐含对系统性知识覆盖及基于集合的组合推理的需求。本文提出 KnowledgeBerg 基准,从知识宽度与推理深度两个正交维度形式化该挑战。数据集涵盖 10 个领域、17 种语言的 4800 道选择题。实验显示开源模型在知识枚举与推理任务上表现严重不足,主要失败于完整性、意识与应用三个阶段。尽管测试时计算与检索增强带来小幅提升,但模型在结构化知识组织与组合推理执行上仍存在显著局限。
AI 推荐理由
论文核心评估 LLM 的组合推理能力,定义推理深度维度并分析失败模式。
研究机构
University of Groningen
LIACS, Leiden University
论文信息