摘要
大语言及视觉语言模型正驱动基于命令行界面的智能体,但现有基准多依赖合成沙盒与短程任务,难以评估真实环境下的长程工作能力。本文提出 WildClawBench,一个包含 60 个双语、多模态任务的原生运行时基准,涵盖六大主题。任务平均耗时 8 分钟,需调用超 20 次工具,并在真实 Docker 容器中运行。评估结合规则检查、状态审计与模型评判。实验显示,即便最强模型在 OpenClaw 框架下成功率仅 62.2%,表明长程原生运行时评估仍是未解难题。
AI 推荐理由
论文聚焦长程任务评估,核心挑战在于多步规划与工具调度,虽为基准测试但紧密围绕规划能力。
研究机构
上海人工智能实验室
中国科学院大学
香港中文大学
复旦大学
上海交通大学
浙江大学
论文信息