Mechanistic Interpretability Looped Architecture Reasoning Dynamics
摘要

推理已成为大语言模型的核心能力。近期研究表明,通过在潜在维度循环 LLM 层可提升推理性能。本文对循环语言模型的潜在状态进行机制分析,对比其与前馈模型的推理阶段差异。研究发现,循环中各层收敛于不同不动点,形成一致的潜在空间轨迹;随着不动点达成,注意力头行为趋于稳定。实证表明,循环块学习了与前馈模型镜像的推理阶段,并在每次迭代中重复。此外,还探讨了循环块大小、输入注入及归一化对这些不动点涌现与稳定性的影响。

AI 推荐理由

论文核心研究循环架构下的推理机制与内部动力学,直接关联推理能力。

研究机构
University of Oxford Université de Montréal
论文信息
作者 Hugh Blayney, Álvaro Arroyo, Johan Obando-Ceron, Pablo Samuel Castro, Aaron Courville et al.
发布日期 2026-04-13
arXiv ID 2604.11791
相关性评分 9/10 (高度相关)