摘要
大型语言模型在自动化计算研究方面潜力巨大,但现有方法多采用固定顺序的智能体流水线,全局协调能力弱,限制了鲁棒性。本文提出分层研究智能体系统(HiRAS),这是一种端到端的实验复现框架,利用监督管理智能体协调各细粒度阶段的专业智能体。此外,针对 Paper2Code 基准中无参考评估的局限性,引入了结合仓库级信息的改进协议 P2C-Ex。广泛评估表明,该方法在开源基座模型上性能提升超 10%,并显著减少了评估幻觉。
AI 推荐理由
提出分层多智能体框架,核心在于通过管理代理协调细粒度阶段的任务规划与执行。
研究机构
The University of Manchester
Singapore University of Technology and Design
论文信息