mathematical reasoning LLM benchmark evaluation
摘要

2026 年 4 月至 5 月,49 位数学家 compiling 了一个包含已知答案的研究级数学问题数据集,主要工作于德国莱比锡马克斯·普朗克科学数学研究所举办的为期三天的“莱比锡基准测试”研讨会期间完成。本文展示了由此产生的 100 个问题集合。我们在三个阶段对这些问题进行评估:首先由五个最先进的大语言模型各尝试一次,随后对其中三个模型进行每模型 20 次运行的评估,最后对两个重型思维模型进行三次运行尝试。结果显示,未解决问题数量从第一阶段的 41 个降至第二阶段的 16 个,最终阶段仅剩 2 个。这表明大语言模型的数学推理能力正变得令人印象深刻。

AI 推荐理由

论文核心评估 LLM 在研究级数学问题上的推理能力,直接对应 reasoning 主题。

研究机构
德国莱比锡大学
论文信息
作者 Andrei Balakin, Miklós Bóna, Marie-Charlotte Brandenburg, Clara Briand, Veronica Calvo Cortes et al.
发布日期 2026-06-04
arXiv ID 2606.05818
相关性评分 9/10 (高度相关)