Software Engineering Agent RLVR Training Trajectory Learning SWE-bench
摘要

针对现有软件工程代理因现实数据中问题描述与解决方案不匹配而受误导的难题,本文提出 SWE-Fuse 训练框架。该框架融合问题导向与无问题样本,包含两个关键模块:一是无问题驱动的轨迹学习模块,旨在消除误导性描述并让模型学习逐步调试过程;二是熵感知 RLVR 训练模块,通过熵驱动裁剪自适应调整训练动态,平衡探索与稳定性。在 SWE-bench Verified 基准上的实验表明,该方法显著提升了代理解决真实软件问题的成功率,优于现有基线模型。

AI 推荐理由

论文核心在于提升 Agent 解决软件工程问题的技能,通过新训练框架优化调试与修复能力。

研究机构
安群集团
论文信息
作者 Xin-Cheng Wen, Binbin Chen, Haoxuan Lan, Hang Yu, Peng Di et al.
发布日期 2026-03-09
arXiv ID 2603.07927
相关性评分 9/10 (高度相关)