摘要
强化学习(RL)已成为超越监督微调提升大语言模型能力的强大范式,但在大规模下维持性能增益仍是挑战。本文提出一种可扩展的多轮合成数据生成流水线,教师模型根据学生表现迭代优化问题,无需微调即可生成结构化难度递进数据。该方法显著提高了有效合成问题的产出率,并自然产生支持课程学习的阶梯式任务变体。系统在 Llama3.1 和 Qwen 系列模型上验证了该方法能持续提升域内代码及多数域外数学任务性能。
AI 推荐理由
论文核心研究通过 RL 和课程学习提升代码生成技能,属于技能学习范畴。
研究机构
图宾根大学
Meta FAIR
Max Planck Institute for Intelligent Systems
论文信息