Small Language Models Software Engineering Agents Reinforcement Learning Self-Improvement
摘要

小语言模型在成本和延迟上具优势,但在长程软件工程任务中表现不佳。本文提出 SWE-Protégé 后训练框架,将软件修复重构为专家与学徒的协作问题。该框架让小模型作为唯一决策者,学习选择性寻求指导、识别停滞状态并执行反馈。结合监督微调与智能体强化学习,有效抑制死循环。实验显示,经轻量后训练的 Qwen2.5-Coder-7B 在 SWE-bench Verified 上通过率提升至 42.4%,显著超越现有小模型水平。

AI 推荐理由

论文提出后训练框架,通过专家协作与强化学习实现小模型的自我改进与能力进化。

研究机构
密歇根大学 斯坦福大学 Meta
论文信息
作者 Patrick Tser Jern Kon, Archana Pradeep, Ang Chen, Alexander P. Ellis, Warren Hunt et al.
发布日期 2026-02-25
arXiv ID 2602.22124
相关性评分 9/10 (高度相关)