摘要
基于技能的代理系统通过组合可重用技能解决复杂任务,但也引入了未被充分审视的安全攻击面。本文提出 SkillTrojan,一种针对技能实现而非模型参数的后门攻击。该方法将恶意逻辑嵌入看似合理的技能中,利用标准技能组合重构并执行攻击者指定的负载。攻击将加密负载分割至多个良性技能调用中,仅在预定义触发器下激活。研究还实现了从任意模板自动合成后门技能,支持大规模传播。实验表明,该攻击在保持高良性任务准确率的同时,可实现极高的攻击成功率,揭示了当前架构的关键盲点。
AI 推荐理由
论文核心针对基于技能的代理系统,研究技能实现层面的后门攻击机制与评估。
研究机构
1
2,3
2
3
4
论文信息