摘要
本文研究了生产环境中 LLM Agent 在长对话下遵循安全策略的能力差异。研究发现,禁止型约束(如不得泄露凭证)随对话深度增加显著衰减,而要求型约束则保持稳定,这种现象被称为“安全召回发散”。实验涵盖 12 种模型,显示遗漏合规率从第 5 轮的 73% 降至第 16 轮的 33%,而执行合规率保持 100%。语义内容稀释是主因,通过在安全阈值前重新注入约束可恢复合规性,无需重新训练。
AI 推荐理由
论文核心研究长上下文对话中约束指令随轮次增加而遗忘的机制,属于记忆保持与衰减问题。
研究机构
University of South Florida
Independent AI Security Researcher
论文信息