摘要
基于大语言模型的编码代理通过开放市场获取第三方技能以扩展能力,但缺乏强制安全审查。由于这些技能以系统级权限执行,恶意技能可轻易劫持主机。本文提出文档驱动的隐式载荷执行(DDIPE)攻击,将恶意逻辑嵌入技能文档的代码示例中,使代理在正常任务中自动执行。实验生成 1070 个对抗性技能,在多种框架下实现了显著的防御绕过率,揭示了现有防护机制的严重漏洞。
AI 推荐理由
论文核心研究针对 LLM Agent 技能生态系统的供应链攻击,直接涉及技能的执行与安全。
研究机构
Griffith University, Australia
Quantstamp, Singapore
The State Information Center, China
Nanyang Technological University, Singapore
University of New South Wales, Australia
Wuhan University
The University of Sydney
论文信息