摘要
拒绝微调(RFT)是训练 LLM 代理的标准方法,通常会丢弃未成功的轨迹。然而,这种方法在处理困难任务时浪费了包含部分正确步骤的宝贵数据。本文提出了步骤拒绝微调(SRFT),利用批评家模型评估轨迹中每一步的正确性,在训练中仅屏蔽错误步骤的损失而非将其完全移除。这使得模型能够学习从错误中恢复而不重犯。在 SWE-bench Verified 上的评估显示,SRFT 将解决率提升了 3.7%,优于传统 RFT 的 2.4%,总解决率达到 32.2%。
AI 推荐理由
提出 SRFT 方法,利用错误轨迹进行微调,使模型具备从错误中恢复和自我改进的能力。
研究机构
JetBrains Research
论文信息