Benchmark Construction Self-Improvement Code Generation Evolutionary Algorithm
摘要

针对大模型导致基准测试饱和的问题,本文提出 BenchEvolver,一种以解为中心的进化框架。该方法通过对参考解决方案进行结构化变换,自动将现有编码问题演化为更难变体,并衍生对应描述与测试用例。实验表明,生成的任务显著提升了难度且保持有效性,成功恢复了模型间的区分度。此外,利用演化任务进行强化学习训练,显著提升了模型在未见代码任务上的表现,证明了其作为自我改进训练信号的价值。

AI 推荐理由

论文提出基于解的进化框架自动生成高难任务,核心机制为自我进化与持续学习信号构建。

研究机构
University of California, Berkeley Institute for Interdisciplinary Information Sciences, Tsinghua University
论文信息
作者 Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou et al.
发布日期 2026-05-31
arXiv ID 2606.01286
相关性评分 9/10 (高度相关)