software evolution coding agents benchmark package upgrade LLM evaluation
摘要

大语言模型驱动的编码智能体正被期望执行超越孤立问题修复的真实软件维护任务。现有基准虽趋向真实软件演进,却鲜少捕捉包发布粒度下的持续维护。本文提出 SWE-Chain,用于评估智能体在链式发布级包升级上的表现,其中每次转换均基于先前的代码库。我们设计了分治合成流水线,将发布说明与代码差异对齐,生成 grounded 的升级规范。实验涵盖 9 个 Python 包的 12 条升级链,结果显示当前智能体在跨版本链式升级中仍难以在不破坏现有功能的前提下正确完成升级。

AI 推荐理由

论文聚焦软件持续演进中的链式升级任务,核心评估 Agent 在版本迭代中的自适应与维护能力。

研究机构
The Chinese University of Hong Kong Technical University of Darmstadt Johns Hopkins University Independent Monash University
论文信息
作者 Man Ho Lam, Chaozheng Wang, Hange Liu, Jingyu Xiao, Haau-sing Li et al.
发布日期 2026-05-14
arXiv ID 2605.14415
相关性评分 9/10 (高度相关)