摘要
本研究在受控条件下,对比了三种脚手架(ReAct、多智能体规划器 - 执行者 - 评估器、规划后执行)在五个主流模型上对 GAIA 基准测试性能的影响。结果显示,仅脚手架选择即可导致同一模型准确率波动高达 28%,证实了脚手架差异显著影响能力评估。研究发现,更强模型在复杂任务中从结构化脚手架获益更多,且多智能体优势仅限于特定模型家族。结果表明,单一脚手架得出的能力评分具有条件依赖性,随着模型进步,这种激发差距未必缩小。
AI 推荐理由
论文核心对比 ReAct、规划器等不同脚手架对 Agent 任务执行的影响,直接聚焦规划架构。
研究机构
Independent Researcher
论文信息