SWE Agents Distillation Chain-of-Thought Long-horizon Tasks
摘要

解决复杂长程任务需强大的规划与推理能力,但显式思维链(CoT)数据获取成本高昂。为此,本文提出后见之明提示蒸馏(HHD),仅需易得的问答对。受人类教师利用学生错误提供指导的启发,HHD 从模型失败的自 rollout 中合成后见之明提示,用于支撑成功完成任务的策略 rollout,随后模型自蒸馏这些轨迹并泛化至新任务。实验表明,HHD 在 SWE-bench Verified 上绝对提升 8%,远超基线,且推理策略能有效泛化至分布外多语言任务。

AI 推荐理由

论文核心提出 HHD 方法,旨在从无 CoT 数据中合成专家级推理策略,显著提升长程任务推理能力。

研究机构
Tsinghua University
论文信息
作者 Shengjie Wang, Guanghe Li, Zonghan Yang, Yang Gao
发布日期 2026-05-12
arXiv ID 2605.11556
相关性评分 9/10 (高度相关)