Tool Retrieval Adversarial Attack LLM Agents Embedding Space
摘要

大型语言模型(LLM)Agent 日益依赖外部工具处理复杂任务,并通常基于嵌入检索选择顶部 k 个工具进行推理。本文指出该检索阶段的鲁棒性尚未得到充分探索,并提出了 ToolFlood,一种针对工具增强型 LLM Agent 的检索层攻击。ToolFlood 不改变检索后的选择结果,而是通过注入少量由攻击者控制的工具,利用嵌入空间的几何特性精心放置其元数据,从而在语义上覆盖大量用户查询。这些恶意工具主导了顶部 k 个结果,将所有良性工具挤出 Agent 的上下文。实验表明,ToolFlood 在低注入率下即可实现高达 95% 的攻击成功率。

AI 推荐理由

论文核心研究工具检索机制的鲁棒性,直接决定 Agent 技能选择与调用的有效性。

研究机构
Cappgemini Invent, Paris, France LaMME, University Paris-Saclay, Evry, France ENSHI, Evry, France
论文信息
作者 Hussein Jawad, Nicolas J-B Brunel
发布日期 2026-03-14
arXiv ID 2603.13950
相关性评分 9/10 (高度相关)