contextual recall in-context learning mechanistic interpretability transformer analysis
摘要

基于 Transformer 的语言模型擅长上下文学习(ICL),其中一种形式为“上下文回忆”,即利用成对示例在新提示格式中召回特定事实。本文探究该能力是否仅源于预训练,以及所需微调与驱动机制。通过构建受控合成框架,研究发现仅靠预训练虽能获取事实知识,但不足以实现上下文回忆;而在需隐式推理的任务上进行微调,可触发该能力的涌现,并伴随低维潜在编码的形成。文章还构建了纯注意力机制的 Transformer 理论模型以解释此过程。

AI 推荐理由

论文核心研究上下文回忆中的隐式推理机制,揭示微调如何激活基于预训练知识的推理能力。

研究机构
美国南加州大学计算机科学学院
论文信息
作者 Bhavya Vasudeva, Puneesh Deora, Alberto Bietti, Vatsal Sharan, Christos Thrampoulidis
发布日期 2026-03-21
arXiv ID 2603.20969
相关性评分 9/10 (高度相关)