Agent Security Supply Chain Attack Skill Ecosystem LLM Safety
摘要

基于大语言模型的编码代理通过开放市场获取第三方技能以扩展能力,但缺乏强制安全审查。由于这些技能以系统级权限执行,恶意技能可轻易劫持主机。本文提出文档驱动的隐式载荷执行(DDIPE)攻击,将恶意逻辑嵌入技能文档的代码示例中,使代理在正常任务中自动执行。实验生成 1070 个对抗性技能,在多种框架下实现了显著的防御绕过率,揭示了现有防护机制的严重漏洞。

AI 推荐理由

论文核心研究针对 LLM Agent 技能生态系统的供应链攻击,直接涉及技能的执行与安全。

研究机构
Griffith University, Australia Quantstamp, Singapore The State Information Center, China Nanyang Technological University, Singapore University of New South Wales, Australia Wuhan University The University of Sydney
论文信息
作者 Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li et al.
发布日期 2026-04-03
arXiv ID 2604.03081
相关性评分 9/10 (高度相关)