摘要
可复用技能已成为扩展大语言模型代理的通用接口,封装了程序性指导及对文件、工具、记忆和执行环境的访问。然而,这种模块化引入了现有安全评估常忽略的攻击面:即使用户请求 benign,任务相关的技能材料或本地工件也可能诱导代理执行不安全行为。本文提出 SkillSafetyBench,一个可运行的基准测试,用于评估此类由技能介导的安全失效。实验表明,局部非用户攻击能一致地引发不安全行为,且在不同领域、攻击方法及架构 - 模型组合中呈现出独特的失效模式。
AI 推荐理由
论文核心研究可复用技能(skills)作为攻击面引发的安全问题,直接评估技能机制的安全性。
研究机构
Shanghai AI Laboratory
Peking University
East China Normal University
论文信息