Self-Training Code Generation Reinforcement Learning Test-Time Scaling
摘要

代码生成通常仅在原始程序空间训练,依赖稀疏的执行反馈。本文指出测试时扩展产生的比较信息构成了更丰富的“双重判断空间”。作者提出 DuST 框架,通过采样候选程序、沙箱执行标记,并利用 GRPO 算法训练模型根据执行正确性对候选项排序。该纯判别式目标使模型能从自身尝试的相对正确结构中學習。实验表明,DuST 显著提升了模型的判断质量与生成能力,单次 rollout 性能即可匹敌基座模型的最佳四选结果,证实了在线强化学习是将双重空间学习迁移回原始生成的关键机制。

AI 推荐理由

提出双空间自训练框架,利用测试时采样反馈实现模型自我改进与进化。

研究机构
Apple University of Illinois Urbana-Champaign
论文信息
作者 Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert et al.
发布日期 2026-05-11
arXiv ID 2605.11299
相关性评分 9/10 (高度相关)