Mathematical Reasoning Benchmark LLM Evaluation Research-level Math
摘要

近期 AI 系统在国际数学奥林匹克中表现卓越,但竞赛数学仅涵盖狭窄领域。本文推出 Riemann-Bench,一个包含 25 个专家策划问题的私有基准,旨在评估超越奥赛前沿的研究级数学推理能力。问题由顶尖学者编写并经过双重盲审验证,确保解的唯一性与严谨性。我们在允许使用代码工具和搜索的无约束设置下评估前沿模型,结果显示所有模型得分均低于 10%,暴露了竞赛解题与真正科研级推理间的巨大鸿沟。

AI 推荐理由

论文核心评估 AI 在研究级数学中的深度推理能力,揭示其与竞赛解题的差距。

研究机构
Surge AI
论文信息
作者 Suhaas Garre, Erik Knutsen, Sushant Mehta, Edwin Chen
发布日期 2026-04-08
arXiv ID 2604.06802
相关性评分 9/10 (高度相关)