摘要
针对现有大语言模型在复杂编程需求下代码生成能力受限的问题,本文提出 RECRL 框架。该方法借鉴软件工程理念,自动感知模型特定的需求难度,优化高难度训练数据,并采用自适应课程采样策略构建平滑难度的训练批次。在五个主流基准测试及五种最先进模型上的实验表明,RECRL 显著优于现有基线,平均 Pass@1 指标提升 1.23% 至 5.62%,有效提升了代码生成性能。
AI 推荐理由
论文核心在于通过强化学习提升 LLM 的代码生成技能,属于典型的技能学习与优化研究。
研究机构
天津大学, 中国
大连海事大学, 中国
论文信息