摘要
本文将大语言模型的推理能力拆解为“回忆”与“状态追踪”两个基本原语,探究结合注意力检索与循环状态更新的混合架构是否优于纯注意力模型。通过对比指令微调及推理增强的 Olmo3 变压器与混合模型,研究发现推理增强显著扩展了模型的有效操作范围。在序列依赖性较强的任务中,混合架构表现出更强的鲁棒性,而纯变压器模型性能随难度增加急剧下降。结果表明,显式推理与架构归纳偏置在不同计算层级发挥作用,底层架构对持久状态传播的支持程度决定了推理增强的效益。
AI 推荐理由
论文核心研究推理的基本原语(回忆与状态追踪)及架构对推理能力的影响。
研究机构
b-it, University of Bonn
Lamarr Institute for ML and AI
论文信息