摘要
本文提出 GraphInfer-Bench,旨在评估大语言模型(LLM)在图数据上的推理能力,即生成无法通过单节点检索或路径遍历获得的开放性答案。现有协议多局限于可检索任务,而本基准涵盖描述与比较两类共五项任务,确保真值分布于邻域结构中。研究包含 4.2 万样本,对比了图令牌对齐、前沿闭源模型、监督微调及传统 GNN。结果显示,没有任何 LLM 方法能完全填补差距,且在社区检测等任务上 plain GNN 表现更优,揭示了图推理仍是待解决的能力缺口。
AI 推荐理由
论文核心评估 LLM 在图结构上的推理能力,定义新基准测试非检索性推断。
研究机构
The Hong Kong University of Science and Technology
Webank
论文信息