Benchmark Graph Reasoning Data Warehouse LLM Evaluation
摘要

本文提出了 DW-Bench,这是一个用于评估大语言模型(LLM)在数据仓库模式上进行图拓扑推理的新基准,明确整合了外键和数据血缘边。该基准包含跨越五种模式的 1046 个自动生成且可验证正确的问题。实验表明,工具增强型方法显著优于静态方法,但在处理复杂的组合子类型时性能趋于饱和。该研究为衡量和提升 LLM 在复杂结构化数据环境下的逻辑推理能力提供了重要依据。

AI 推荐理由

论文核心评估 LLM 在数据仓库图拓扑上的推理能力,直接对应推理主题。

研究机构
Innosol / Bahçeşehir University Department of Computer Engineering, Bahçeşehir University, Turkey
论文信息
作者 Ahmed G. A. H Ahmed, C. Okan Sakar
发布日期 2026-04-21
arXiv ID 2604.18964
相关性评分 9/10 (高度相关)