Self-Improvement Fine-Tuning SWE-bench Error Recovery
摘要

拒绝微调(RFT)是训练 LLM 代理的标准方法,通常会丢弃未成功的轨迹。然而,这种方法在处理困难任务时浪费了包含部分正确步骤的宝贵数据。本文提出了步骤拒绝微调(SRFT),利用批评家模型评估轨迹中每一步的正确性,在训练中仅屏蔽错误步骤的损失而非将其完全移除。这使得模型能够学习从错误中恢复而不重犯。在 SWE-bench Verified 上的评估显示,SRFT 将解决率提升了 3.7%,优于传统 RFT 的 2.4%,总解决率达到 32.2%。

AI 推荐理由

提出 SRFT 方法,利用错误轨迹进行微调,使模型具备从错误中恢复和自我改进的能力。

研究机构
JetBrains Research
论文信息
作者 Igor Slinko, Ilia Zavidnyi, Egor Bogomolov, Yaroslav Zharov
发布日期 2026-05-11
arXiv ID 2605.10674
相关性评分 9/10 (高度相关)