摘要
大语言模型驱动的 Agent 在自动化软件工程任务(如静态缺陷修复)方面展现出强大能力,但现有基准多局限于静态单次修复范式,难以反映真实世界中基于复杂需求变更和长期功能迭代的软件开发过程。为此,本文提出 SWE-CI,这是首个基于持续集成循环的仓库级基准,旨在将代码生成评估范式从静态短期的“功能正确性”转向动态长期的“可维护性”。该基准包含 100 个任务,平均对应真实代码库中跨度 233 天、历经 71 次连续提交的演进历史,要求 Agent 通过数十轮分析与编码迭代系统性地解决问题,从而深入洞察 Agent 在长期演进中维持代码质量的能力。
AI 推荐理由
论文聚焦代码库长期演进与维护,评估 Agent 在持续迭代中的自适应能力,核心契合自我进化主题。
研究机构
Sun Yat-sen University
Alibaba Group
论文信息