Code Generation Multi-Agent Systems Reinforcement Learning Task Planning
摘要

大型语言模型在代码生成中表现优异,但自回归解码缺乏全局规划,常导致局部连贯却全局次优的解。针对多智能体系统中的协调与专业化挑战,本文提出 CoRe-Code 框架。该框架采用“规划者 - 编码者”范式,由规划者制定高层计划,编码者执行生成代码。此外,引入基于组相对策略优化(GRPO)的协同感知强化学习阶段,以增强角色专业化与对齐。实验表明,该方法在多个基准测试中准确率、执行效率及内存使用上均优于现有方法,并具备良好的泛化性。

AI 推荐理由

论文提出 Planner-Coder 范式,核心解决代码生成中的全局规划与多智能体协作问题。

研究机构
The Ohio State University Kean University Royal Melbourne Institute of Technology
论文信息
作者 Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas
发布日期 2026-05-24
arXiv ID 2605.24812
相关性评分 9/10 (高度相关)