数学推理 数据集构建 多智能体 模型微调
摘要

数学前沿由未知解的问题定义,但语言模型能否在无干预下参与尚不明确。主要障碍是缺乏大规模研究级数学数据集。为此,我们引入 ResearchMath-14k,这是通过多智能体流程从学术来源整理的 14,056 个问题集合,也是迄今最大的研究级数学问题库。我们进一步生成了包含 22 万条教师轨迹的 ResearchMath-Reasoning 数据集,观察到模型存在回避尝试和伪造引用等行为。经智能体过滤后微调 Qwen3 模型,平均性能提升 9.2 分,表明即使无完全正确的推理轨迹,过滤后的开放问题尝试也能提供有效监督。

AI 推荐理由

论文聚焦研究级数学推理,构建数据集并提升模型推理能力,核心贡献在于推理。

研究机构
Seoul National University OneLineAI Yonsei University
论文信息
作者 Guijin Son, Seungyeop Yi, Minju Gwak, Hyunwoo Ko, Wongi Jang et al.
发布日期 2026-05-27
arXiv ID 2605.28003
相关性评分 9/10 (高度相关)