Graph Inference Benchmark LLM Evaluation Graph Neural Networks
摘要

本文提出 GraphInfer-Bench,旨在评估大语言模型(LLM)在图数据上的推理能力,即生成无法通过单节点检索或路径遍历获得的开放性答案。现有协议多局限于可检索任务,而本基准涵盖描述与比较两类共五项任务,确保真值分布于邻域结构中。研究包含 4.2 万样本,对比了图令牌对齐、前沿闭源模型、监督微调及传统 GNN。结果显示,没有任何 LLM 方法能完全填补差距,且在社区检测等任务上 plain GNN 表现更优,揭示了图推理仍是待解决的能力缺口。

AI 推荐理由

论文核心评估 LLM 在图结构上的推理能力,定义新基准测试非检索性推断。

研究机构
The Hong Kong University of Science and Technology Webank
论文信息
作者 Zhuoyi Peng, Jingzhou Jiang, Hanlin Gu, Lixin Fan, Yi Yang
发布日期 2026-06-10
arXiv ID 2606.11562
相关性评分 9/10 (高度相关)