摘要
代码生成通常仅在原始程序空间训练,依赖稀疏的执行反馈。本文指出测试时扩展产生的比较信息构成了更丰富的“双重判断空间”。作者提出 DuST 框架,通过采样候选程序、沙箱执行标记,并利用 GRPO 算法训练模型根据执行正确性对候选项排序。该纯判别式目标使模型能从自身尝试的相对正确结构中學習。实验表明,DuST 显著提升了模型的判断质量与生成能力,单次 rollout 性能即可匹敌基座模型的最佳四选结果,证实了在线强化学习是将双重空间学习迁移回原始生成的关键机制。
AI 推荐理由
提出双空间自训练框架,利用测试时采样反馈实现模型自我改进与进化。
研究机构
Apple
University of Illinois Urbana-Champaign
论文信息