摘要
针对代码生成中重复采样导致推理路径冗余的问题,本文提出协调式 Pass@K 策略优化(CPPO)。该方法将生成过程转化为联合策略探索:由规划器输出一组多样化的高层算法策略,求解器针对每种策略尝试求解。通过引入乘法形式的规划奖励,仅对经验证器确认成功的策略组合赋予信用。实验表明,在相同计算预算下,CPPO 在多个代码基准上显著优于直接采样及现有规划基线,有效提升了代码推理的通过率。
AI 推荐理由
论文提出 CPPO,核心是规划器生成多种高层策略元组,属于任务规划与多步计划生成的核心研究。
研究机构
University of Wisconsin-Madison
NVIDIA Research
论文信息