摘要
本文研究了 Transformer 是否在难度递增的任务中自适应地利用其网络深度。通过基于家庭故事的多跳关系推理任务(难度由需组合的关系跳跃数决定),利用早期读出(logit lens)监测预测在各层的演变,并通过因果修补分析跨 token 的信息整合。研究发现,预训练模型在简单任务上仅需较少层即可得出合理答案,且随链长增加会使用更多层整合信息;微调模型则展现出更清晰一致的自适应深度使用证据,尤其在未保留通用语言建模能力的宽松微调设置下效果更显著。
AI 推荐理由
论文核心研究 Transformer 在关系推理任务中如何自适应利用深度,直接探讨推理机制。
研究机构
Microsoft Research Cambridge
论文信息