摘要
随着 Agent 生态系统日益依赖可安装技能扩展功能,部分技能将学习到的模型工件捆绑于执行逻辑中,引发了未被传统提示注入覆盖的供应链风险。本文提出 BadSkill,一种针对“技能内模型”威胁面的后门攻击方法。攻击者发布看似无害的技能,其嵌入模型经后门微调,仅在特定语义触发条件下激活恶意负载。实验表明,该攻击在多种架构下成功率高达 99.5%,揭示了携带模型的技能作为独特供应链风险的严重性,呼吁加强第三方技能工件的来源验证与行为审查。
AI 推荐理由
论文核心研究 Agent 技能(Skills)中的模型嵌入安全与后门攻击机制,直接针对技能执行逻辑。
研究机构
华中科技大学
上海大学
论文信息