摘要
本文提出 DecisionBench,一个用于评估长程智能体工作流中涌现性委托能力的基准框架。该框架固定了任务套件、模型池及委托接口,并提供多维度的评估指标,涵盖质量、成本、延迟及路由保真度等。通过对全模型池的大规模实验,研究发现仅关注任务质量会忽略编排信号,而交付通道对路由效果影响显著。此外,反事实分析表明当前方法距离完美委托仍有巨大提升空间,为未来编排策略提供了明确方向。
AI 推荐理由
论文聚焦长程工作流中的任务委托与路由,属于多步规划与目标导向行为的核心研究。
研究机构
OpenMesh AI
University of Pennsylvania
Columbia University
Stanford University
论文信息