Spectral Memory Small Language Models Long-context Efficiency SeqCond Attention
摘要

本文提出 Nautile-370M,一款专为严格参数和推理预算下高效推理设计的 3.71 亿参数小型语言模型。该模型采用混合骨干网络,交替使用两层序列条件注意力(SCA)层与一层 Transformer 层。SCA 是一种受 SeqCondenser 启发的线性时间谱序列算子,旨在保留结构化序列模型的长上下文效率与状态追踪优势,同时维持注意力机制的令牌间路由表达能力。理论证明 SCA 读取机制能精确检索前缀摘要中的任意令牌,并在连续极限下至少具备与全自注意力同等的表达力。此外,文章还描述了训练数据流水线及针对推理、验证和响应质量的强化学习阶段。

AI 推荐理由

论文核心提出谱记忆机制,旨在解决长上下文效率与状态追踪,属记忆架构研究。

研究机构
Maixent Chenebaux
论文信息
作者 Maixent Chenebaux
发布日期 2026-04-27
arXiv ID 2604.24809
相关性评分 9/10 (高度相关)