Agent Evaluation Cybersecurity Pentesting Benchmark
摘要

当前 AI 渗透测试 Agent 的基准测试多局限于简化场景下的预设目标,难以反映真实世界的复杂性。本文提出一种实用的评估协议,将评估重点从任务完成转向经验证的漏洞发现。该协议结合结构化真值与基于大语言模型的语义匹配,采用二分法解决模糊性评分,并支持对随机性 Agent 进行累积评估。通过涵盖多攻击面和漏洞类的复杂目标,本协议实现了更具操作指导意义的 Agent 对比,并开源了相关代码与标注数据以确保可复现性。

AI 推荐理由

论文聚焦渗透测试 Agent 在复杂环境中的战略决策与开放式探索规划能力评估。

研究机构
Ethiack University of Notre Dame
论文信息
作者 Pedro Conde, Henrique Branquinho, Valerio Mazzone, Bruno Mendes, André Baptista et al.
发布日期 2026-05-11
arXiv ID 2605.10834
相关性评分 8/10 (高度相关)