Agent Security Tool Use Prompt Injection Deception Detection
摘要

针对工具使用型 LLM Agent 的间接提示注入防御存在两大缺陷:仅试图预防而非检测漏网之鱼,且缺乏低资源语言评估。本文提出 AgentShield,一种基于欺骗的检测框架,在工具接口中部署虚假工具、凭证及参数白名单三层陷阱。这些陷阱触发器作为自监督分类器的高精度标签,能实时捕捉遵循攻击指令的 Agent 行为。实验表明,该方法在商业模型上捕获了 90.7%-100% 的成功攻击,无误报,且具备跨语言和跨模型的泛化能力。

AI 推荐理由

论文聚焦工具使用 Agent 的安全防御,核心在于保护工具调用技能免受攻击,虽非技能学习本身,但紧密相关。

研究机构
Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewler, Erbil, Iraq Artificial Intelligence and Innovation Centre, University of Kurdistan Hewler, Erbil, Iraq
论文信息
作者 Yassin H. Rassul, Tarik A. Rashid
发布日期 2026-05-10
arXiv ID 2605.11026
相关性评分 8/10 (高度相关)