摘要
大型语言模型日益依赖知识编辑以支持知识密集型推理,但这引入了严重的安全风险:攻击者可注入恶意知识破坏下游推理。现有基准主要关注编辑效能,缺乏统一框架评估其对推理行为的安全影响。为此,本文提出 EditRisk-Bench,系统评估恶意知识编辑下的安全风险。该基准整合了虚假信息、偏见等多种恶意场景及多层级推理任务,衡量攻击有效性、推理正确性及副作用。实验表明,恶意编辑能可靠诱导不安全推理且难以检测,同时保持通用能力。
AI 推荐理由
论文核心研究恶意知识编辑对知识密集型推理行为及安全性的直接影响与评估。
研究机构
上海交通大学计算机科学与技术学院
论文信息