Multi-Agent System Task Planning Code Generation Experiment Reproduction
摘要

大型语言模型在自动化计算研究方面潜力巨大,但现有方法多采用固定顺序的智能体流水线,全局协调能力弱,限制了鲁棒性。本文提出分层研究智能体系统(HiRAS),这是一种端到端的实验复现框架,利用监督管理智能体协调各细粒度阶段的专业智能体。此外,针对 Paper2Code 基准中无参考评估的局限性,引入了结合仓库级信息的改进协议 P2C-Ex。广泛评估表明,该方法在开源基座模型上性能提升超 10%,并显著减少了评估幻觉。

AI 推荐理由

提出分层多智能体框架,核心在于通过管理代理协调细粒度阶段的任务规划与执行。

研究机构
The University of Manchester Singapore University of Technology and Design
论文信息
作者 Hanhua Hong, Yizhi LI, Jiaoyan Chen, Sophia Ananiadou, Xiaoli Li et al.
发布日期 2026-04-20
arXiv ID 2604.17745
相关性评分 9/10 (高度相关)