摘要
大型语言模型智能体日益被期望在企业环境中运行,但现有基准多评估拥有广泛工具权限的单智能体,缺乏对角色专业化、访问控制及策略审批等现实约束的模拟。本文提出 EntCollabBench,一个用于评估企业多智能体协作的基准。该基准模拟了包含 11 个角色专用智能体的权限隔离组织,涵盖工作流执行与策略审批两个子集。实验表明,当前模型在端到端企业协作中仍面临委托、上下文转移及工作流闭环等挑战,为本领域提供了可复现的测试平台。
AI 推荐理由
论文聚焦多智能体在企业工作流中的协作规划、任务分解与流程闭环,是核心研究。
研究机构
BAIR
CASIA
UCAS
Peking University
论文信息