摘要
本文介绍了 SWE-ZERO 到 SWE-HERO 的两阶段监督微调方案,通过蒸馏开源前沿大模型在 SWE-bench 上取得最先进成果。该流程采用进化式优化策略替代高资源依赖:首先利用大规模无执行轨迹掌握代码语义与仓库级推理;随后应用基于执行的针对性精炼,将语义直觉转化为严谨的工程工作流。实验表明,该方法为同量级开源模型树立了新基准,且展现出强大的跨语言零样本迁移能力。
AI 推荐理由
论文提出两阶段进化微调策略,核心在于通过自我迭代和基于执行的反馈实现代理能力的显著跃升。
研究机构
NVIDIA
论文信息