摘要
大型语言模型在代码生成中表现优异,但自回归解码缺乏全局规划,常导致局部连贯却全局次优的解。针对多智能体系统中的协调与专业化挑战,本文提出 CoRe-Code 框架。该框架采用“规划者 - 编码者”范式,由规划者制定高层计划,编码者执行生成代码。此外,引入基于组相对策略优化(GRPO)的协同感知强化学习阶段,以增强角色专业化与对齐。实验表明,该方法在多个基准测试中准确率、执行效率及内存使用上均优于现有方法,并具备良好的泛化性。
AI 推荐理由
论文提出 Planner-Coder 范式,核心解决代码生成中的全局规划与多智能体协作问题。
研究机构
The Ohio State University
Kean University
Royal Melbourne Institute of Technology
论文信息