摘要
大语言模型在单轮交互中表现优异,但在长程多轮对话中常丢失指令、人设及规则。本文提出“通道转换”解释:定义目标的 token 通过注意力机制变得不可访问,而相关信息可能留存于残差表示中。我们引入目标可访问比率(GAR),结合滑动窗口消融与残差流探测,发现不同架构在注意力关闭时呈现 distinct 失败模式。实验表明,即使注意力丧失,线性探针仍能从残差表示中高准确度恢复目标信息,揭示了记忆保持的深层架构机制。
AI 推荐理由
核心研究多轮交互中指令遗忘的注意力机制与残差记忆表征,深入解析记忆保持机理。
研究机构
University of Illinois Urbana-Champaign
Adobe Research
论文信息