mathematical reasoning multimodal benchmark retrieval-augmented generation Olympiad math
摘要

针对现有基准在规模、语言覆盖及任务多样性上的局限,本文提出 MathNet,一个包含 3 万余道专家编写的奥林匹克级数学问题的高质量、大规模、多模态及多语言数据集。该研究构建了涵盖问题解决、数学感知检索及检索增强求解的三大任务基准。实验表明,即便最先进的推理模型在此基准上仍面临挑战,而检索质量显著影响生成性能。MathNet 提供了最大的高质量奥赛数据集及首个数学问题检索评估基准。

AI 推荐理由

论文核心是构建数学推理基准,评估并提升模型的逻辑与数学推理能力。

研究机构
MIT KAUST HUMAIN Individual Researcher Equal Contribution
论文信息
作者 Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei et al.
发布日期 2026-04-20
arXiv ID 2604.18584
相关性评分 9/10 (高度相关)