Code Agent Sparse Activation Reinforcement Learning Tool Use
摘要

本文介绍了 Qwen3-Coder-Next,一款专为代码智能体设计的开源语言模型。该模型拥有 800 亿参数,但推理时仅激活 30 亿,实现了高效推理与强大编码能力的平衡。研究探索了小参数 footprint 模型在强训练策略下的能力极限,通过大规模合成可验证编码任务并结合可执行环境,利用中期训练和强化学习直接从环境反馈中学习。在 SWE-Bench 和 Terminal-Bench 等以智能体为中心的基准测试中,其表现相对于激活参数量具有竞争力。我们发布了基座和指令微调版本,以支持研究与实际代码智能体开发。

AI 推荐理由

论文核心聚焦于代码 Agent 的技能训练,通过环境反馈和强化学习提升工具使用与编码能力。

研究机构
通义千问团队
论文信息
作者 Ruisheng Cao, Mouxiang Chen, Jiawei Chen, Zeyu Cui, Yunlong Feng et al.
发布日期 2026-02-28
arXiv ID 2603.00729
相关性评分 9/10 (高度相关)