摘要
竞技编程仍是人类对抗 AI 的最后堡垒之一。本文提出 GrandCode,一种专为竞技编程设计的多智能体强化学习系统。其卓越能力源于两点:一是协调假设提出、求解器、测试生成等多个智能体模块,并通过后训练及在线测试时强化学习共同提升;二是引入专为多阶段智能体 rollout 设计的 Agentic GRPO 算法,有效解决延迟奖励与严重的离策漂移问题。GrandCode 是首个在实时竞赛中稳定超越所有人类选手(包括传奇大师)的 AI 系统,标志着 AI 在高难度编程任务上已超越最强人类程序员。
AI 推荐理由
论文核心在于通过多智能体强化学习与自我反思机制实现系统能力的持续进化与超越。
研究机构
DeepReinforce Team
论文信息