Self-Evolving Data Preparation LLM Training Automatic Pipeline
摘要

高质量训练数据对大语言模型至关重要,但通常依赖昂贵的人工策展。现有自动方法受限于预定义流程,缺乏适应性。本文提出 DataEvolver,这是首个自进化数据准备系统,能自动构建管道将原始数据转化为高质量数据。该系统采用多层级机制:在算子层级增量扩展集合以构建逻辑计划并解决冲突;在管道层级实例化代码并通过反馈循环迭代优化,缩小数据分布差距。实验表明,该方法显著提升了下游模型性能。

AI 推荐理由

论文提出首个自进化数据准备系统,核心机制为多层级自我进化与迭代优化。

研究机构
Renmin University of China
论文信息
作者 Chao Deng, Shaolei Zhang, Ju Fan, Xiaoyong Du
发布日期 2026-06-05
arXiv ID 2606.07001
相关性评分 9/10 (高度相关)