Mathematical Reasoning Benchmark Theorem Proving LLM Evaluation
摘要

本文提出了一种评估大语言模型(LLM)在研究级数学能力的新方法。现有基准多依赖静态的竞赛或教科书式问题,而本研究建立了一个可更新的基准,直接利用最新的数学研究成果进行评估。该基准通过自动流水线从 arXiv 提取引理,并将其重写为包含所有假设和定义的独立陈述。实验表明,当前最先进的 LLM 在定理证明任务上的准确率仅为 10%-15%,显示出其距离人类水平的研究能力仍有巨大差距。

AI 推荐理由

论文核心评估 LLM 在数学研究级的定理证明能力,属于高阶逻辑与数学推理范畴。

研究机构
ENS Rennes École des Ponts, IP Paris 韩国高等研究院
论文信息
作者 Antoine Peyronnet, Fabian Gloeckle, Amaury Hayat
发布日期 2026-02-27
arXiv ID 2602.24173
相关性评分 9/10 (高度相关)