Agent Orchestration Task Delegation Benchmark Long-Horizon Planning
摘要

本文提出 DecisionBench,一个用于评估长程智能体工作流中涌现性委托能力的基准框架。该框架固定了任务套件、模型池及委托接口,并提供多维度的评估指标,涵盖质量、成本、延迟及路由保真度等。通过对全模型池的大规模实验,研究发现仅关注任务质量会忽略编排信号,而交付通道对路由效果影响显著。此外,反事实分析表明当前方法距离完美委托仍有巨大提升空间,为未来编排策略提供了明确方向。

AI 推荐理由

论文聚焦长程工作流中的任务委托与路由,属于多步规划与目标导向行为的核心研究。

研究机构
OpenMesh AI University of Pennsylvania Columbia University Stanford University
论文信息
作者 Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu
发布日期 2026-05-18
arXiv ID 2605.19099
相关性评分 9/10 (高度相关)