摘要
基于 Transformer 的语言模型擅长上下文学习(ICL),其中一种形式为“上下文回忆”,即利用成对示例在新提示格式中召回特定事实。本文探究该能力是否仅源于预训练,以及所需微调与驱动机制。通过构建受控合成框架,研究发现仅靠预训练虽能获取事实知识,但不足以实现上下文回忆;而在需隐式推理的任务上进行微调,可触发该能力的涌现,并伴随低维潜在编码的形成。文章还构建了纯注意力机制的 Transformer 理论模型以解释此过程。
AI 推荐理由
论文核心研究上下文回忆中的隐式推理机制,揭示微调如何激活基于预训练知识的推理能力。
研究机构
美国南加州大学计算机科学学院
论文信息