Multi-Agent Reinforcement Learning Code Generation GPU Programming Skill Learning
摘要

针对现有 LLM 方法仅关注单内核优化而难以实现端到端 GPU 程序生成的挑战,本文提出 StitchCUDA 框架。该框架包含规划、编码和验证三个专用智能体,并引入基于准则的智能体强化学习,通过任务转代码生成和反馈驱动优化两项原子技能,结合真实执行奖励,显著提升编码能力。实验表明,该方法在端到端任务中成功率近 100%,性能显著优于基线模型,有效防止了奖励欺骗行为。

AI 推荐理由

论文核心在于通过强化学习提升 Agent 的代码生成与优化技能,属于典型的技能学习范畴。

研究机构
明尼苏达大学双城分校计算机科学与工程系
论文信息
作者 Shiyang Li, Zijian Zhang, Winson Chen, Yuebo Luo, Mingyi Hong et al.
发布日期 2026-03-03
arXiv ID 2603.02637
相关性评分 9/10 (高度相关)