摘要
高质量训练数据对大语言模型至关重要,但通常依赖昂贵的人工策展。现有自动方法受限于预定义流程,缺乏适应性。本文提出 DataEvolver,这是首个自进化数据准备系统,能自动构建管道将原始数据转化为高质量数据。该系统采用多层级机制:在算子层级增量扩展集合以构建逻辑计划并解决冲突;在管道层级实例化代码并通过反馈循环迭代优化,缩小数据分布差距。实验表明,该方法显著提升了下游模型性能。
AI 推荐理由
论文提出首个自进化数据准备系统,核心机制为多层级自我进化与迭代优化。
研究机构
Renmin University of China
论文信息