摘要
本文针对 AI 智能体在网络安全领域的双重用途风险,提出了 ExploitGym 基准,旨在评估其将漏洞转化为具体攻击的能力。该任务极具挑战性,要求智能体具备低级程序推理、运行时适应及长程规划能力。ExploitGym 包含来自用户空间程序、V8 引擎及 Linux 内核的 898 个真实漏洞实例,并在可复现的容器环境中测试不同防御配置下的表现。评估显示,尽管任务困难,前沿模型仍能成功利用部分漏洞,即使在启用常用防御机制时仍保持显著成功率,突显了日益增长的网络安全风险。
AI 推荐理由
论文核心评估 Agent 的低级程序推理与运行时适应能力,推理是成功利用漏洞的关键。
研究机构
UC Berkeley
Max Planck Institute for Security and Privacy
UC Santa Barbara
Arizona State University
Anthropic
OpenAI
Google
论文信息