摘要
针对大模型导致基准测试饱和的问题,本文提出 BenchEvolver,一种以解为中心的进化框架。该方法通过对参考解决方案进行结构化变换,自动将现有编码问题演化为更难变体,并衍生对应描述与测试用例。实验表明,生成的任务显著提升了难度且保持有效性,成功恢复了模型间的区分度。此外,利用演化任务进行强化学习训练,显著提升了模型在未见代码任务上的表现,证明了其作为自我改进训练信号的价值。
AI 推荐理由
论文提出基于解的进化框架自动生成高难任务,核心机制为自我进化与持续学习信号构建。
研究机构
University of California, Berkeley
Institute for Interdisciplinary Information Sciences, Tsinghua University
论文信息