摘要
本文提出了一种评估大语言模型(LLM)在研究级数学能力的新方法。现有基准多依赖静态的竞赛或教科书式问题,而本研究建立了一个可更新的基准,直接利用最新的数学研究成果进行评估。该基准通过自动流水线从 arXiv 提取引理,并将其重写为包含所有假设和定义的独立陈述。实验表明,当前最先进的 LLM 在定理证明任务上的准确率仅为 10%-15%,显示出其距离人类水平的研究能力仍有巨大差距。
AI 推荐理由
论文核心评估 LLM 在数学研究级的定理证明能力,属于高阶逻辑与数学推理范畴。
研究机构
ENS Rennes
École des Ponts, IP Paris
韩国高等研究院
论文信息