摘要
小语言模型在成本和延迟上具优势,但在长程软件工程任务中表现不佳。本文提出 SWE-Protégé 后训练框架,将软件修复重构为专家与学徒的协作问题。该框架让小模型作为唯一决策者,学习选择性寻求指导、识别停滞状态并执行反馈。结合监督微调与智能体强化学习,有效抑制死循环。实验显示,经轻量后训练的 Qwen2.5-Coder-7B 在 SWE-bench Verified 上通过率提升至 42.4%,显著超越现有小模型水平。
AI 推荐理由
论文提出后训练框架,通过专家协作与强化学习实现小模型的自我改进与能力进化。
研究机构
密歇根大学
斯坦福大学
Meta
论文信息