Agent Security Backdoor Attack Skill Composition LLM Agents
摘要

基于技能的代理系统通过组合可重用技能解决复杂任务,但也引入了未被充分审视的安全攻击面。本文提出 SkillTrojan,一种针对技能实现而非模型参数的后门攻击。该方法将恶意逻辑嵌入看似合理的技能中,利用标准技能组合重构并执行攻击者指定的负载。攻击将加密负载分割至多个良性技能调用中,仅在预定义触发器下激活。研究还实现了从任意模板自动合成后门技能,支持大规模传播。实验表明,该攻击在保持高良性任务准确率的同时,可实现极高的攻击成功率,揭示了当前架构的关键盲点。

AI 推荐理由

论文核心针对基于技能的代理系统,研究技能实现层面的后门攻击机制与评估。

研究机构
1 2,3 2 3 4
论文信息
作者 Yunhao Feng, Yifan Ding, Yingshui Tan, Boren Zheng, Yanming Guo et al.
发布日期 2026-04-08
arXiv ID 2604.06811
相关性评分 9/10 (高度相关)