摘要
大语言模型正从被动信息提供者转向复杂工作流的主动代理,但在企业部署中因缺乏捕捉专业环境细微差别的基准而受阻,特别是长程规划和持久状态变化需求。本文提出 EnterpriseOps-Gym,一个包含容器化沙箱、164 个数据库表及 512 个功能工具的基准,旨在评估真实企业场景中的代理规划能力。通过对 14 个前沿模型的评估发现,即使表现最佳的模型成功率仅 37.4%,且提供理想人类计划可显著提升性能,表明战略推理是主要瓶颈。此外,代理常无法拒绝不可行任务,存在潜在风险。研究强调当前代理尚未准备好自主企业部署。
AI 推荐理由
论文核心聚焦于企业环境下的长程规划能力评估,明确指出战略推理是主要瓶颈。
研究机构
1
2
3
1,2,3
论文信息