multi-turn interaction attention mechanism residual stream mechanistic interpretability long-context memory
摘要

大语言模型在单轮交互中表现优异,但在长程多轮对话中常丢失指令、人设及规则。本文提出“通道转换”解释:定义目标的 token 通过注意力机制变得不可访问,而相关信息可能留存于残差表示中。我们引入目标可访问比率(GAR),结合滑动窗口消融与残差流探测,发现不同架构在注意力关闭时呈现 distinct 失败模式。实验表明,即使注意力丧失,线性探针仍能从残差表示中高准确度恢复目标信息,揭示了记忆保持的深层架构机制。

AI 推荐理由

核心研究多轮交互中指令遗忘的注意力机制与残差记忆表征,深入解析记忆保持机理。

研究机构
University of Illinois Urbana-Champaign Adobe Research
论文信息
作者 Vardhan Dongre, Joseph Hsieh, Viet Dac Lai, Seunghyun Yoon, Trung Bui et al.
发布日期 2026-05-13
arXiv ID 2605.12922
相关性评分 9/10 (高度相关)