Long-Context Safety Memory Decay Agent Reliability
摘要

本文研究了生产环境中 LLM Agent 在长对话下遵循安全策略的能力差异。研究发现,禁止型约束(如不得泄露凭证)随对话深度增加显著衰减,而要求型约束则保持稳定,这种现象被称为“安全召回发散”。实验涵盖 12 种模型,显示遗漏合规率从第 5 轮的 73% 降至第 16 轮的 33%,而执行合规率保持 100%。语义内容稀释是主因,通过在安全阈值前重新注入约束可恢复合规性,无需重新训练。

AI 推荐理由

论文核心研究长上下文对话中约束指令随轮次增加而遗忘的机制,属于记忆保持与衰减问题。

研究机构
University of South Florida Independent AI Security Researcher
论文信息
作者 Yeran Gamage
发布日期 2026-04-22
arXiv ID 2604.20911
相关性评分 9/10 (高度相关)