摘要
推理已成为大语言模型的核心能力。近期研究表明,通过在潜在维度循环 LLM 层可提升推理性能。本文对循环语言模型的潜在状态进行机制分析,对比其与前馈模型的推理阶段差异。研究发现,循环中各层收敛于不同不动点,形成一致的潜在空间轨迹;随着不动点达成,注意力头行为趋于稳定。实证表明,循环块学习了与前馈模型镜像的推理阶段,并在每次迭代中重复。此外,还探讨了循环块大小、输入注入及归一化对这些不动点涌现与稳定性的影响。
AI 推荐理由
论文核心研究循环架构下的推理机制与内部动力学,直接关联推理能力。
研究机构
University of Oxford
Université de Montréal
论文信息