摘要
大型语言模型具备强大的上下文学习能力,但其追踪和检索上下文信息的机制尚不明确。本文借鉴认知科学中的自由回忆范式,发现开源大模型一致表现出类似序列回忆的模式,即对输入序列中重复标记后的下一个标记赋予最高概率。通过系统性消融实验证明,专门关注当前标记前一次出现位置后一标记的“归纳头”在该现象中起关键作用。移除高归纳得分的头显著降低了 +1 滞后偏差,并严重损害了少-shot 学习下的序列回忆性能。研究揭示了归纳头与 Transformer 时间上下文处理之间的具体机制联系。
AI 推荐理由
论文核心研究归纳头在上下文学习中处理时间依赖和序列回忆的机制,直接关联记忆检索。
研究机构
印第安纳大学布卢明顿分校计算机科学系
论文信息