摘要
本文提出了 DW-Bench,这是一个用于评估大语言模型(LLM)在数据仓库模式上进行图拓扑推理的新基准,明确整合了外键和数据血缘边。该基准包含跨越五种模式的 1046 个自动生成且可验证正确的问题。实验表明,工具增强型方法显著优于静态方法,但在处理复杂的组合子类型时性能趋于饱和。该研究为衡量和提升 LLM 在复杂结构化数据环境下的逻辑推理能力提供了重要依据。
AI 推荐理由
论文核心评估 LLM 在数据仓库图拓扑上的推理能力,直接对应推理主题。
研究机构
Innosol / Bahçeşehir University
Department of Computer Engineering, Bahçeşehir University, Turkey
论文信息