摘要
基于大语言模型的智能体常在多会话中维持任务状态以确保连续性,且在团队部署中常跨用户复用共享知识层。这种共享持久化扩大了故障面:局部有效的信息若被无视范围地重应用,会静默降低其他用户的任务效果,即“无意跨用户污染”(UCC)。不同于对抗性记忆投毒,UCC 源于良性交互产生的范围限定伪影的持续存在与误用。本文形式化了 UCC 评估协议,提出三类污染分类法,并在两种共享状态机制中评估发现,原始共享状态下污染率高达 57%-71%。写入时清洗对对话类状态有效,但对含可执行伪影的状态仍存在显著残余风险,常表现为静默错误答案。结果表明,防止此类故障需超越文本层面的伪影级防御。
AI 推荐理由
论文核心研究共享状态下的记忆污染机制,直接针对多用户场景的记忆架构安全性。
研究机构
University of Southern California
Michigan State University
Northwestern University
论文信息