Coding Agent Software Evolution Evaluation Framework Technical Debt
摘要

现有编码代理数据集仅以无状态方式评估孤立任务,无法反映现实软件开发中代码累积、技术债务增长及测试套件演进的真实性。为此,本文提出自动化任务生成框架及 SWE-STEPS 数据集,通过对话式迭代请求和基于需求文档的单次编码两种场景,评估代理在依赖链式 PR 中的表现。研究发现,孤立评估因忽略先前低效或错误代码的溢出效应,导致成功率虚高约 20%;即便代理解决问题,其生成的代码认知复杂度与技术债务仍高于人类,凸显多维评估的必要性。

AI 推荐理由

论文聚焦软件序列进化中的代理评估,核心关注技术债务累积与长期仓库健康,属自我进化范畴。

研究机构
Fujitsu
论文信息
作者 KN Ajay Shastry, Ganesh Senrayan, Shrey Satapara, Pranoy Panda, Chaitanya Devaguptapu
发布日期 2026-04-03
arXiv ID 2604.03035
相关性评分 9/10 (高度相关)