Agent Benchmark Enterprise AI Long-horizon Planning Tool Use
摘要

大语言模型正从被动信息提供者转向复杂工作流的主动代理,但在企业部署中因缺乏捕捉专业环境细微差别的基准而受阻,特别是长程规划和持久状态变化需求。本文提出 EnterpriseOps-Gym,一个包含容器化沙箱、164 个数据库表及 512 个功能工具的基准,旨在评估真实企业场景中的代理规划能力。通过对 14 个前沿模型的评估发现,即使表现最佳的模型成功率仅 37.4%,且提供理想人类计划可显著提升性能,表明战略推理是主要瓶颈。此外,代理常无法拒绝不可行任务,存在潜在风险。研究强调当前代理尚未准备好自主企业部署。

AI 推荐理由

论文核心聚焦于企业环境下的长程规划能力评估,明确指出战略推理是主要瓶颈。

研究机构
1 2 3 1,2,3
论文信息
作者 Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair, Sagar Davasam, Aman Tiwari et al.
发布日期 2026-03-13
arXiv ID 2603.13594
相关性评分 9/10 (高度相关)