Agentic Coding Reinforcement Learning Code Generation MoE
摘要

本文介绍了快手 KwaiKAT 团队开发的智能体编码模型 KAT-Coder-V2。该模型采用“先专精后统一”范式,将编码任务分解为五个专家领域独立进行监督微调与强化学习,再通过在线策略蒸馏整合。团队开发了支持大规模并发沙箱的 KwaiEnv 基础设施,并提出 MCLA 稳定混合专家强化训练,以及树形训练法消除冗余计算。实验表明,该模型在 SWE-bench Verified 等基准测试中表现优异,接近或超越主流闭源模型。

AI 推荐理由

论文核心在于构建具备多领域编码技能的智能体,通过专家微调与强化学习提升工具使用能力。

研究机构
KwaiKAT Team at Kuaishou
论文信息
作者 Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao et al.
发布日期 2026-03-29
arXiv ID 2603.27703
相关性评分 9/10 (高度相关)