摘要
本文提出 GTBench,这是一个基于课程体系的基准,旨在评估大语言模型(LLM)作为图论数学研究助手的能力。该基准包含 63 个问题,分为本科定义、算法追踪及研究生级证明构建三个难度层级。研究评估了五种前沿模型在零样本和思维链提示下的表现。结果显示模型性能随难度增加显著下降,且高阶证明中存在推理不完整及人工与自动评估不一致的问题。GTBench 为首个针对图论推理的课程化评估框架,对 AI 在数学教育中的应用具有重要启示。
AI 推荐理由
论文核心评估 LLM 在图论中的数学推理、证明构建及思维链能力。
研究机构
Louisiana State University, USA
Los Alamos National Laboratory, USA
Texas A&M-Central Texas, USA
论文信息