LLM Security Tool Use Prompt Injection Red Teaming Agent Safety
摘要

针对工具使用型 Agent 中的间接提示注入威胁,本文提出 AgentRedBench,一个涵盖 24 种企业集成、215 个细微授权场景的动态红队基准。评估显示无防护下攻击成功率高达 81%。为此,作者开源了基于多样化对抗性工具响应内容训练的防御模型 AgentRedGuard。该模型将平均攻击成功率从 69.9% 降至 2.4%,显著优于现有开源基线,并在跨集成和跨攻击类型中表现出良好的泛化能力,有效保障了 Agent 工具调用的安全性。

AI 推荐理由

论文核心研究 Agent 工具使用中的安全威胁与防御,直接关联技能学习中的工具调用机制。

研究机构
StackOne
论文信息
作者 Hiskias Dingeto, Will Leeney
发布日期 2026-06-01
arXiv ID 2606.02240
相关性评分 9/10 (高度相关)