摘要

本文提出 SIR-Bench,一个包含 794 个测试用例的基准,旨在评估自主安全事件响应代理,区分真正的法医调查与单纯的警报复述。该基准源自 129 个匿名化事件模式,通过

AI 推荐理由

论文核心评估 Agent 在安全响应中主动调查、发现新证据及恰当使用工具的技能。

研究机构
Amazon Web Services
论文信息
作者 Daniel Begimher, Cristian Leo, Jack Huang, Pat Gaw, Bonan Zheng
发布日期 2026-04-13
arXiv ID 2604.12040
相关性评分 9/10 (高度相关)