Data Curation Self-Evolution Pretraining Automated Strategy
摘要

本文提出 DataEvolve 框架,旨在解决大规模异构预训练语料中人工设计策略的局限性。该框架通过闭环进化循环,自动识别数据质量问题、生成候选策略、执行评估并迭代优化。在涵盖 6720 亿 token 的实验中,DataEvolve 经 30 轮迭代生成了 Darwin-CC 数据集。基于该数据训练的模型在多项基准测试中显著优于现有方法,证实了策略自动进化的可行性与必要性,尤其提升了知识密集型任务表现。

AI 推荐理由

论文提出 DataEvolve 框架,通过迭代优化自动进化数据清洗策略,核心聚焦自我进化机制。

研究机构
清华大学 微软亚洲研究院
论文信息
作者 Tiantian Mi, Dongming Shan, Zhen Huang, Yiwei Qin, Muhang Xie et al.
发布日期 2026-03-15
arXiv ID 2603.14420
相关性评分 9/10 (高度相关)