摘要
随着模型家族、训练配方和计算预算日益标准化,机器学习系统的进一步增益愈发依赖数据。然而,数据工程仍主要依靠人工且临时性强。本文研究任务条件的自主数据工程,旨在通过优化数据侧(包括外部数据发现、选择、组合、清洗和转换)来提升固定学习算法的性能。针对自主数据工程中存在的开放搜索空间、分支依赖细化及延迟验证等挑战,提出了 DataMaster 框架。该框架集成树状搜索、共享候选数据和累积记忆机制,包含组织备选分支的 DataTree、存储可复用数据源的共享数据池,以及记录节点结果与可复用发现的全局记忆。实验表明,该方法在多个基准测试中显著提升了下游任务表现。
AI 推荐理由
论文提出全局记忆机制以跨分支积累数据工程经验,是解决开放搜索空间的关键组件。
研究机构
上海交通大学
卡内基梅隆大学
浙江大学
北京航空航天大学
论文信息