Agent Security Skill Injection LLM Defense Adversarial Attack
摘要

大型语言模型代理日益依赖描述特定任务流程的可复用技能文档,但这引入了新的攻击面。本研究探讨两个互补方向:首先评估基于守护者的防御机制,包括作为技能文件访问中介的动态守护者及构建时预重写文件的静态守护者。实验显示,在三个代理家族中,守护者将攻击成功率降低过半且保留任务效用。其次,通过四种保持恶意指令但改变措辞的攻击重构进行压力测试。结果表明,动态守护者能将重构攻击的成功率从 81.4% 显著降至 18.6%,证明实时中介是鲁棒的防御手段。

AI 推荐理由

论文核心研究基于技能文件的攻击与防御,直接涉及 Agent 技能管理机制的安全性。

研究机构
Patronus AI NVIDIA
论文信息
作者 Yoshinari Fujinuma, Varun Gangal, Traian Rebedea, Makesh Narasimhan Sreedhar, Prasoon Varshney et al.
发布日期 2026-06-01
arXiv ID 2606.01567
相关性评分 9/10 (高度相关)