摘要
针对代码代理强化学习中反馈信号微弱的问题,本文以代理编译修复为场景,研究了标准 GRPO 算法的信号重塑方法。文章提出,只有对结果奖励、过程信号及 rollout 可比性进行重塑,组内比较才具有意义。通过构建最小化信号重塑方案,结合分层奖励、步级过程评分及故障感知管控,显著提升了模型性能。实验表明,该方法将严格准确率从 0.385 提升至 0.535,并减少了评估步数,证明了其在促进 Agent 自我进化方面的有效性。
AI 推荐理由
论文核心研究利用强化学习(GRPO)和信号重塑机制,使 Agent 在弱反馈下自我改进代码修复能力。
研究机构
The Chinese University of Hong Kong
Sun Yat-sen University
论文信息