摘要
针对现有基准在规模、语言覆盖及任务多样性上的局限,本文提出 MathNet,一个包含 3 万余道专家编写的奥林匹克级数学问题的高质量、大规模、多模态及多语言数据集。该研究构建了涵盖问题解决、数学感知检索及检索增强求解的三大任务基准。实验表明,即便最先进的推理模型在此基准上仍面临挑战,而检索质量显著影响生成性能。MathNet 提供了最大的高质量奥赛数据集及首个数学问题检索评估基准。
AI 推荐理由
论文核心是构建数学推理基准,评估并提升模型的逻辑与数学推理能力。
研究机构
MIT
KAUST
HUMAIN
Individual Researcher
Equal Contribution
论文信息