摘要
本文提出 SkillHarm,一个涵盖技能使用全生命周期的基于技能攻击基准及系统风险分类法。研究定义了固定载荷投毒与自我变异投毒两种攻击场景,并针对数据管道、系统环境及代理自主性划分了 12 类风险。通过构建自动化流水线 AutoSkillHarm,生成了包含 71 项技能的 879 个攻击样本。实验表明当前代理极易受攻,成功率高达 86.3%,且现有防御机制难以有效缓解此类威胁。
AI 推荐理由
论文核心研究 Agent 技能的安全性与攻击机制,直接针对技能生命周期构建基准。
研究机构
The Ohio State University
Amazon AGI
Stanford University
论文信息