摘要
记忆增强的 LLM 智能体利用迭代反思与自我进化解决复杂任务,但这引入了安全风险。现有攻击需特权访问或显式恶意内容,易被检测。本文探索了一种更隐蔽的攻击面:诱导智能体生成局部正确但导致有害泛化的经验。我们提出“强迫性经验投毒”(OEP),一种低权限黑盒攻击,通过构建结合局部正确解、不可迁移方法及严重后果的对抗性边缘案例, bias 反思过程形成过度谨慎的规则。评估显示,OEP 在 GPT-4o 上攻击成功率超 50%,且优于现有防御下的攻击方法。
AI 推荐理由
论文核心研究针对自我进化机制的攻击,直接利用反思与经验固化过程诱导有害规则生成。
研究机构
上海交通大学
论文信息