Agent Training Synthetic Data Self-Improvement Scientific Discovery
摘要

随着 AI 智能体的出现,自动科学发现成为可行目标。针对现有系统缺乏原则性训练方法且常生成无效想法的问题,本文提出了一种面向机器学习智能体的新型合成环境生成流水线。该流水线自动生成兼容 SWE-agent 框架的挑战,涵盖主题采样、数据集提案及代码生成,并通过真实数据集验证与自调试循环确保质量。在 MLGym 基准测试中,利用教师模型生成的轨迹训练学生模型,显著提升了其性能,Qwen3-4B 和 Qwen3-8B 的 AUP 指标分别提高了 9% 和 12%。

AI 推荐理由

论文核心在于通过合成任务训练学生模型,实现 Agent 从执行中学习并自我改进,显著提升性能。

研究机构
普林斯顿大学 微软研究
论文信息
作者 Ziyang Cai, Harkirat Behl
发布日期 2026-03-17
arXiv ID 2603.17216
相关性评分 9/10 (高度相关)