Multi-Agent Systems Software Engineering Execution Feedback Autonomous Agents
摘要

大型语言模型虽能生成看似合理的代码,却无法验证其正确性。现有系统多模拟执行或将验证设为可选。本文提出“基于执行的验证”作为首要原则,要求所有代码变更必须在沙箱环境中通过执行测试方可传播。据此构建了 AgentForge 多智能体框架,包含规划、编码、测试、调试及批评智能体,通过共享记忆与强制 Docker 沙箱协同工作。该方法将软件工程形式化为基于仓库状态的迭代决策过程,利用执行反馈提供比下一词概率更强的监督信号。在 SWE-BENCH Lite 基准上,该框架分辨率达 40.0%,显著优于单智能体基线。

AI 推荐理由

论文核心在于多智能体协作框架,通过规划器与执行反馈闭环解决软件工程任务,高度契合规划主题。

研究机构
Kumar with International Research Center for Complexity Sciences, Hangzhou International Innovation Institute, Beihang University, Hangzhou, 311105, China Department of Computer Science, College of Science, Mathematics and Technology, Wenzhou-Kean University, Wenzhou 325060, China Faculty of Information Technology, Universiti Teknologi Malaysia, 81310, Malaysia Computer Systems Engineering Department, Sukkur IBA University, Sindh, Pakistan
论文信息
作者 Rajesh Kumar, Waqar Ali, Junaid Ahmed, Najma Imtiaz Ali, Shaban Usman
发布日期 2026-04-13
arXiv ID 2604.13120
相关性评分 9/10 (高度相关)