Reinforcement Learning Agent Evolution Synthetic Data MLE Agents
摘要

随着大语言模型智能体从软件工程迈向机器学习工程,验证成本剧增导致在线策略强化学习难以实施。现有方法多退回到监督微调或离线奖励,牺牲了探索与泛化优势。本文提出 SandMLE,一种多智能体框架,能从少量种子任务生成多样且可验证的合成机器学习环境,并将数据集压缩至微规模。实验表明,该方法将执行时间缩短逾 13 倍,首次实现了该领域的大规模在线轨迹级强化学习,在多个基准测试中显著优于基线,并展现出强大的泛化能力。

AI 推荐理由

论文核心在于通过合成环境实现 Agent 的大规模在线策略强化学习,显著提升自我进化能力。

研究机构
Meta AI
论文信息
作者 Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan et al.
发布日期 2026-04-06
arXiv ID 2604.04872
相关性评分 9/10 (高度相关)