Self-Improving Data Engineering Test-Driven Feedback Loop
摘要

将人类专业知识可靠地迁移到大语言模型仍具挑战。现有微调缺乏反馈机制,无法诊断训练数据缺陷。本文提出“用数据编程”范式,将数据工程生命周期映射为软件开发流程:训练数据即源代码,训练即编译,基准测试即单元测试,失败驱动的数据修复即调试。该方法能将模型失败分解为概念缺失或推理断裂,并追溯至具体数据缺陷进行针对性修复。实验涵盖十六个学科,证明该循环能持续提升不同规模模型的性能且不损害通用能力,为构建可靠的专业大模型奠定了原则性基础。

AI 推荐理由

提出数据驱动的自我改进框架,通过失败诊断与修复实现模型持续进化。

研究机构
浙江大学 中国科学院大学 上海人工智能实验室
论文信息
作者 Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li et al.
发布日期 2026-04-27
arXiv ID 2604.24819
相关性评分 9/10 (高度相关)