摘要
本文定义了“神谕投毒”攻击类别,即 adversaries 通过破坏 AI 代理运行时查询的结构化知识图谱,导致其在推理正确的情况下得出错误结论。与提示注入不同,该攻击操纵的是推理数据而非指令。研究在包含 4200 万节点的代码知识图谱上演示了六种攻击场景,实证表明所有测试模型在中等攻击复杂度下对投毒数据的信任度达 100%。实验还揭示了交付模式的关键影响,并评估了五种防御机制,其中只读访问控制能有效消除恶意修改向量。
AI 推荐理由
论文核心研究通过污染知识图谱误导 Agent 推理过程,直接针对推理能力的鲁棒性。
研究机构
Microsoft
UNSW Canberra
SAP
OWASP Gen AI Security Project
论文信息