摘要
近期 AI 系统在国际数学奥林匹克中表现卓越,但竞赛数学仅涵盖狭窄领域。本文推出 Riemann-Bench,一个包含 25 个专家策划问题的私有基准,旨在评估超越奥赛前沿的研究级数学推理能力。问题由顶尖学者编写并经过双重盲审验证,确保解的唯一性与严谨性。我们在允许使用代码工具和搜索的无约束设置下评估前沿模型,结果显示所有模型得分均低于 10%,暴露了竞赛解题与真正科研级推理间的巨大鸿沟。
AI 推荐理由
论文核心评估 AI 在研究级数学中的深度推理能力,揭示其与竞赛解题的差距。
研究机构
Surge AI
论文信息