Benchmark Agent Evaluation Terminal Automation Tool Use
摘要

本文介绍了 TerminalWorld,一个可扩展的数据引擎,能自动从野生终端记录中逆向工程出高保真评估任务。该引擎处理了 80,870 条记录,生成涵盖 18 个类别、1,280 个独特命令的 1,530 个验证任务基准,并精选了 200 个人工审核的代表性子集。对八个前沿模型和六个智能体的综合评测显示,当前系统在真实终端工作流中表现挣扎,最高通过率仅 62.5%。TerminalWorld 捕捉到与现有专家策划基准不同的真实能力,且其自动化构造确保了评估的真实性与可扩展性。

AI 推荐理由

论文核心评估 Agent 在真实终端环境中的工具使用与命令执行技能,构建基准测试。

研究机构
University College London Nanjing University Tencent
论文信息
作者 Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li et al.
发布日期 2026-05-21
arXiv ID 2605.22535
相关性评分 9/10 (高度相关)