组合推理 知识覆盖 基准评测 LLM 局限性
摘要

许多现实问题隐含对系统性知识覆盖及基于集合的组合推理的需求。本文提出 KnowledgeBerg 基准,从知识宽度与推理深度两个正交维度形式化该挑战。数据集涵盖 10 个领域、17 种语言的 4800 道选择题。实验显示开源模型在知识枚举与推理任务上表现严重不足,主要失败于完整性、意识与应用三个阶段。尽管测试时计算与检索增强带来小幅提升,但模型在结构化知识组织与组合推理执行上仍存在显著局限。

AI 推荐理由

论文核心评估 LLM 的组合推理能力,定义推理深度维度并分析失败模式。

研究机构
University of Groningen LIACS, Leiden University
论文信息
作者 Xiao Zhang, Qianru Meng, Yongjian Chen, Yumeng Wang, Johan Bos
发布日期 2026-04-19
arXiv ID 2604.17621
相关性评分 9/10 (高度相关)