Agent Evaluation Long-Horizon Planning Software Engineering Benchmark
摘要

代码代理已广泛应用于实际软件开发,但现有基准多关注单问题修复,无法捕捉真实工程规模下的长周期、多目标开发挑战。本文提出 RoadmapBench,包含基于 17 个开源仓库和 5 种语言的 115 个长周期编码任务。每个任务要求代理依据多目标路线图指令,将源代码升级至目标版本功能,平均涉及 51 个文件的 3700 行修改。对 13 个前沿模型的评估显示,最强模型仅解决 39.1% 的任务,表明长周期软件开发仍是未解难题。

AI 推荐理由

论文聚焦长周期任务规划与多目标路线图执行,是规划能力的核心研究。

研究机构
UniPat AI Peking University
论文信息
作者 Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao et al.
发布日期 2026-05-15
arXiv ID 2605.15846
相关性评分 9/10 (高度相关)