Code Generation Reinforcement Learning Strategy Planning Pass@K Optimization
摘要

针对代码生成中重复采样导致推理路径冗余的问题,本文提出协调式 Pass@K 策略优化(CPPO)。该方法将生成过程转化为联合策略探索:由规划器输出一组多样化的高层算法策略,求解器针对每种策略尝试求解。通过引入乘法形式的规划奖励,仅对经验证器确认成功的策略组合赋予信用。实验表明,在相同计算预算下,CPPO 在多个代码基准上显著优于直接采样及现有规划基线,有效提升了代码推理的通过率。

AI 推荐理由

论文提出 CPPO,核心是规划器生成多种高层策略元组,属于任务规划与多步计划生成的核心研究。

研究机构
University of Wisconsin-Madison NVIDIA Research
论文信息
作者 Yilong Li, Suman Banerjee, Tong Che
发布日期 2026-05-26
arXiv ID 2605.27000
相关性评分 9/10 (高度相关)