摘要
本文介绍了 TerminalWorld,一个可扩展的数据引擎,能自动从野生终端记录中逆向工程出高保真评估任务。该引擎处理了 80,870 条记录,生成涵盖 18 个类别、1,280 个独特命令的 1,530 个验证任务基准,并精选了 200 个人工审核的代表性子集。对八个前沿模型和六个智能体的综合评测显示,当前系统在真实终端工作流中表现挣扎,最高通过率仅 62.5%。TerminalWorld 捕捉到与现有专家策划基准不同的真实能力,且其自动化构造确保了评估的真实性与可扩展性。
AI 推荐理由
论文核心评估 Agent 在真实终端环境中的工具使用与命令执行技能,构建基准测试。
研究机构
University College London
Nanjing University
Tencent
论文信息