摘要
随着前沿大语言模型在国际数学奥林匹克竞赛中达到金牌水平,社区正寻求衡量其推理能力的下一个挑战目标。与研究级数学问题相比,奥赛风格问题仅衡量逐步推理,而前者旨在推动数学知识边界。为此,本文介绍了 Soohak,这是一个由 64 位数学家从头创作的包含 439 个问题的基准。该基准包含挑战子集和拒绝子集,后者专门测试模型识别病态问题并拒绝回答的能力。实验显示,当前最先进模型在该基准上表现仍有巨大提升空间,特别是在“拒绝”能力上无一模型超过 50%,确立了新的优化方向。
AI 推荐理由
论文核心是评估 LLM 在研究级数学问题上的推理能力,直接针对逻辑与深度推理。
研究机构
Seoul National University
论文信息