摘要
针对现有 LLM 方法仅关注单内核优化而难以实现端到端 GPU 程序生成的挑战,本文提出 StitchCUDA 框架。该框架包含规划、编码和验证三个专用智能体,并引入基于准则的智能体强化学习,通过任务转代码生成和反馈驱动优化两项原子技能,结合真实执行奖励,显著提升编码能力。实验表明,该方法在端到端任务中成功率近 100%,性能显著优于基线模型,有效防止了奖励欺骗行为。
AI 推荐理由
论文核心在于通过强化学习提升 Agent 的代码生成与优化技能,属于典型的技能学习范畴。
研究机构
明尼苏达大学双城分校计算机科学与工程系
论文信息