摘要
数学前沿由未知解的问题定义,但语言模型能否在无干预下参与尚不明确。主要障碍是缺乏大规模研究级数学数据集。为此,我们引入 ResearchMath-14k,这是通过多智能体流程从学术来源整理的 14,056 个问题集合,也是迄今最大的研究级数学问题库。我们进一步生成了包含 22 万条教师轨迹的 ResearchMath-Reasoning 数据集,观察到模型存在回避尝试和伪造引用等行为。经智能体过滤后微调 Qwen3 模型,平均性能提升 9.2 分,表明即使无完全正确的推理轨迹,过滤后的开放问题尝试也能提供有效监督。
AI 推荐理由
论文聚焦研究级数学推理,构建数据集并提升模型推理能力,核心贡献在于推理。
研究机构
Seoul National University
OneLineAI
Yonsei University
论文信息