摘要
本文提出 SIR-Bench,一个包含 794 个测试用例的基准,旨在评估自主安全事件响应代理,区分真正的法医调查与单纯的警报复述。该基准源自 129 个匿名化事件模式,通过
AI 推荐理由
论文核心评估 Agent 在安全响应中主动调查、发现新证据及恰当使用工具的技能。
研究机构
Amazon Web Services
论文信息