Mathematical Reasoning Benchmark Graph Theory Chain-of-Thought
摘要

本文提出 GTBench,这是一个基于课程体系的基准,旨在评估大语言模型(LLM)作为图论数学研究助手的能力。该基准包含 63 个问题,分为本科定义、算法追踪及研究生级证明构建三个难度层级。研究评估了五种前沿模型在零样本和思维链提示下的表现。结果显示模型性能随难度增加显著下降,且高阶证明中存在推理不完整及人工与自动评估不一致的问题。GTBench 为首个针对图论推理的课程化评估框架,对 AI 在数学教育中的应用具有重要启示。

AI 推荐理由

论文核心评估 LLM 在图论中的数学推理、证明构建及思维链能力。

研究机构
Louisiana State University, USA Los Alamos National Laboratory, USA Texas A&M-Central Texas, USA
论文信息
作者 Noujoud Nader, Ibrahem Aljabea, Patrick Diehl, Deepti Gupta
发布日期 2026-06-02
arXiv ID 2606.03144
相关性评分 9/10 (高度相关)