摘要
在无人类先验条件下合成高质量数学推理数据仍具挑战。现有方法常受限于模式崩溃和逻辑复杂度不足。本文提出一种分层合成框架,将数据合成建模为约束图上的无监督优化问题。引入“立法者 - 执行者”范式:立法者对抗性演化编码问题约束的结构化蓝图,执行者将其实例化为多样化的自然语言场景。这种解耦设计专注于构建复杂逻辑结构。实验表明,仅在 1000 个合成样本上微调的模型,在八个数学基准测试中均优于同等规模的常用数据集,展现出卓越的分布外泛化能力。
AI 推荐理由
论文核心在于通过进化约束图合成高质量数学推理数据,直接提升模型推理能力。
研究机构
华为大模型技术实验室
论文信息