AI Security Knowledge Graph Agent Reasoning Adversarial Attack
摘要

本文定义了“神谕投毒”攻击类别,即 adversaries 通过破坏 AI 代理运行时查询的结构化知识图谱,导致其在推理正确的情况下得出错误结论。与提示注入不同,该攻击操纵的是推理数据而非指令。研究在包含 4200 万节点的代码知识图谱上演示了六种攻击场景,实证表明所有测试模型在中等攻击复杂度下对投毒数据的信任度达 100%。实验还揭示了交付模式的关键影响,并评估了五种防御机制,其中只读访问控制能有效消除恶意修改向量。

AI 推荐理由

论文核心研究通过污染知识图谱误导 Agent 推理过程,直接针对推理能力的鲁棒性。

研究机构
Microsoft UNSW Canberra SAP OWASP Gen AI Security Project
论文信息
作者 Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario et al.
发布日期 2026-05-10
arXiv ID 2605.09822
相关性评分 9/10 (高度相关)