摘要
本文对来自七个提供商的十个前沿模型在 NYU CTF Bench 的 200 个挑战上进行了全面的跨模型评估。基于 D-CIPHER 多智能体框架,研究扩展了多后端支持、预装百余种渗透工具的定制 Kali Linux 环境及运行时工具发现代理。实验表明,Kali 环境显著优于 Ubuntu,而自动提示在装备精良环境中往往降低性能。结果显示,环境工具链和模型选择是性能的关键驱动因素,提示工程干预效果有限甚至负面,反映了模型推理能力与工具集成的兼容性。
AI 推荐理由
论文核心评估 LLM Agent 在渗透测试中的工具使用、环境交互及技能执行能力。
研究机构
Department of Cybersecurity
论文信息