摘要
本文引入“预演”(prolepsis)概念,描述 Transformer 在任务中过早做出决策且后续层无法修正的现象。通过在开源模型上复现规划位点发现,研究揭示了规划对特定注意力头的依赖、搜索与承诺所需的层数差异,以及规划头与事实回忆头在网络深度上的分离。结果表明,预演是一种架构特性,其模板共享但路由基质不同,为理解小型模型的规划机制提供了新视角。
AI 推荐理由
论文核心研究 Transformer 中规划决策的早期不可逆承诺机制及架构基础。
研究机构
Cosmic AI
论文信息