Automated Program Repair Reinforcement Learning Self-Improvement Code Generation
摘要

针对程序修复中强化学习面临的执行反馈稀疏及序列级奖励粗糙问题,本文提出 BoostAPR 框架。该框架包含三个阶段:首先利用带推理轨迹的执行验证数据进行监督微调;其次训练双重奖励模型,分别评估序列级别和分配行级别信用;最后通过 PPO 算法优化,将奖励重新分配至关键编辑区域。实验表明,该方法在多个基准测试中显著优于基线模型,并展现出强大的跨语言泛化能力。

AI 推荐理由

论文利用强化学习与自我反思机制优化代码修复能力,属于 Agent 自我改进与进化的核心研究。

研究机构
State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China University of Luxembourg, Correspondence to: Yuanhao Li , Hongbo Wang
论文信息
作者 Yuanhao Li, Hongbo Wang, Xiaotang Shang, Xunzhu Tang, Yiming Cao et al.
发布日期 2026-05-09
arXiv ID 2605.09134
相关性评分 9/10 (高度相关)