Code Generation Reinforcement Learning Curriculum Learning
摘要

针对现有大语言模型在复杂编程需求下代码生成能力受限的问题,本文提出 RECRL 框架。该方法借鉴软件工程理念,自动感知模型特定的需求难度,优化高难度训练数据,并采用自适应课程采样策略构建平滑难度的训练批次。在五个主流基准测试及五种最先进模型上的实验表明,RECRL 显著优于现有基线,平均 Pass@1 指标提升 1.23% 至 5.62%,有效提升了代码生成性能。

AI 推荐理由

论文核心在于通过强化学习提升 LLM 的代码生成技能,属于典型的技能学习与优化研究。

研究机构
天津大学, 中国 大连海事大学, 中国
论文信息
作者 Shouyu Yin, Zhao Tian, Junjie Chen, Shikai Guo
发布日期 2026-05-01
arXiv ID 2605.00433
相关性评分 9/10 (高度相关)