mathematical reasoning benchmark LLM evaluation research-level math
摘要

随着前沿大语言模型在国际数学奥林匹克竞赛中达到金牌水平,社区正寻求衡量其推理能力的下一个挑战目标。与研究级数学问题相比,奥赛风格问题仅衡量逐步推理,而前者旨在推动数学知识边界。为此,本文介绍了 Soohak,这是一个由 64 位数学家从头创作的包含 439 个问题的基准。该基准包含挑战子集和拒绝子集,后者专门测试模型识别病态问题并拒绝回答的能力。实验显示,当前最先进模型在该基准上表现仍有巨大提升空间,特别是在“拒绝”能力上无一模型超过 50%,确立了新的优化方向。

AI 推荐理由

论文核心是评估 LLM 在研究级数学问题上的推理能力,直接针对逻辑与深度推理。

研究机构
Seoul National University
论文信息
作者 Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko, Hyein Lee et al.
发布日期 2026-05-09
arXiv ID 2605.09063
相关性评分 9/10 (高度相关)