摘要
本文系统基准测试了四种多智能体编排架构(顺序流水线、并行扇出合并、分层监督 - 工作及反射自纠正循环),在五个前沿大模型及一万份 SEC 文件上进行评估。研究涵盖字段级 F1、延迟、成本等维度,发现反射架构精度最高但成本昂贵,而分层架构在成本 - 精度帕累托前沿表现最优。此外,通过语义缓存和自适应重试等混合配置,能以较低成本恢复大部分精度增益,并为大规模部署提供扩展性指导。
AI 推荐理由
论文核心研究多智能体编排架构(顺序、分层、反射等),本质是任务规划与执行策略的对比。
研究机构
纽约大学计算机科学与工程系
论文信息