Test-Time Scaling Self-Improvement Code Generation Self-Play
摘要

针对现有方法依赖真实单元测试(GT UTs)的瓶颈,本文提出 CoSPlay,一种无需训练且无需真实数据的测试时扩展框架。该方法通过协同自博弈机制,联合优化代码与单元测试:首先探索多样化解法以识别潜在失败模式,生成判别性测试思路;随后利用代码 - 测试执行矩阵的双向通过率信号,迭代剪枝弱代码并更新不可靠测试,促使两者共同进化;最后基于输出一致性聚类选择最终代码。实验表明,该方法显著提升了代码生成性能与测试准确率,优于现有无真实数据基线。

AI 推荐理由

论文提出协同自博弈框架,使代码与单元测试在测试时共同迭代进化,核心机制为自我改进。

研究机构
The Hong Kong University of Science and Technology (Guangzhou) Institute of Deep Perception Technology, JITRI, Wuxi, China
论文信息
作者 Zhangyi Hu, Chenhui Liu, Tian Huang, Jindong Li, Yang Yang et al.
发布日期 2026-05-22
arXiv ID 2605.23491
相关性评分 9/10 (高度相关)