摘要
本文提出 DataEvolve 框架,旨在解决大规模异构预训练语料中人工设计策略的局限性。该框架通过闭环进化循环,自动识别数据质量问题、生成候选策略、执行评估并迭代优化。在涵盖 6720 亿 token 的实验中,DataEvolve 经 30 轮迭代生成了 Darwin-CC 数据集。基于该数据训练的模型在多项基准测试中显著优于现有方法,证实了策略自动进化的可行性与必要性,尤其提升了知识密集型任务表现。
AI 推荐理由
论文提出 DataEvolve 框架,通过迭代优化自动进化数据清洗策略,核心聚焦自我进化机制。
研究机构
清华大学
微软亚洲研究院
论文信息