摘要
当前 AI 渗透测试 Agent 的基准测试多局限于简化场景下的预设目标,难以反映真实世界的复杂性。本文提出一种实用的评估协议,将评估重点从任务完成转向经验证的漏洞发现。该协议结合结构化真值与基于大语言模型的语义匹配,采用二分法解决模糊性评分,并支持对随机性 Agent 进行累积评估。通过涵盖多攻击面和漏洞类的复杂目标,本协议实现了更具操作指导意义的 Agent 对比,并开源了相关代码与标注数据以确保可复现性。
AI 推荐理由
论文聚焦渗透测试 Agent 在复杂环境中的战略决策与开放式探索规划能力评估。
研究机构
Ethiack
University of Notre Dame
论文信息