Reinforcement Learning Code Generation Adversarial Verification Dataset Evolution
摘要

针对现有代码强化学习数据集中验证信号弱且静态的问题,本文提出一种基于解条件且具备对抗性的验证框架。该框架依据候选代码的执行行为迭代优化测试用例,旨在提升难度、判别力并减少冗余。基于此构建了大规模数据集 EvolveCoder-22k。实证表明,迭代优化显著增强了验证效果,使 pass@1 从 43.80% 降至 31.22%。在该数据集上的强化学习实现了稳定优化,使 Qwen3-4B 在四个基准上平均提升 4.2 分,优于同规模基线,凸显了对抗性验证在代码生成中的重要性。

AI 推荐理由

论文核心提出对抗性验证框架以迭代进化测试用例,直接对应自我进化主题。

研究机构
滑铁卢大学 哈佛大学
论文信息
作者 Chi Ruan, Dongfu Jiang, Huaye Zeng, Ping Nie, Wenhu Chen
发布日期 2026-03-13
arXiv ID 2603.12698
相关性评分 9/10 (高度相关)