Cybersecurity Benchmark Program Reasoning AI Safety
摘要

本文针对 AI 智能体在网络安全领域的双重用途风险,提出了 ExploitGym 基准,旨在评估其将漏洞转化为具体攻击的能力。该任务极具挑战性,要求智能体具备低级程序推理、运行时适应及长程规划能力。ExploitGym 包含来自用户空间程序、V8 引擎及 Linux 内核的 898 个真实漏洞实例,并在可复现的容器环境中测试不同防御配置下的表现。评估显示,尽管任务困难,前沿模型仍能成功利用部分漏洞,即使在启用常用防御机制时仍保持显著成功率,突显了日益增长的网络安全风险。

AI 推荐理由

论文核心评估 Agent 的低级程序推理与运行时适应能力,推理是成功利用漏洞的关键。

研究机构
UC Berkeley Max Planck Institute for Security and Privacy UC Santa Barbara Arizona State University Anthropic OpenAI Google
论文信息
作者 Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr et al.
发布日期 2026-05-11
arXiv ID 2605.11086
相关性评分 8/10 (高度相关)