Cybersecurity Agent Benchmarking Tool Use LLM Evaluation
摘要

本文对来自七个提供商的十个前沿模型在 NYU CTF Bench 的 200 个挑战上进行了全面的跨模型评估。基于 D-CIPHER 多智能体框架,研究扩展了多后端支持、预装百余种渗透工具的定制 Kali Linux 环境及运行时工具发现代理。实验表明,Kali 环境显著优于 Ubuntu,而自动提示在装备精良环境中往往降低性能。结果显示,环境工具链和模型选择是性能的关键驱动因素,提示工程干预效果有限甚至负面,反映了模型推理能力与工具集成的兼容性。

AI 推荐理由

论文核心评估 LLM Agent 在渗透测试中的工具使用、环境交互及技能执行能力。

研究机构
Department of Cybersecurity
论文信息
作者 Tyler H. Merves, Michael H. Conaway, Joseph M. Escobar, Hakan T. Otal, Unal Tatar
发布日期 2026-04-18
arXiv ID 2604.17159
相关性评分 9/10 (高度相关)