论文

Nautile-370M:频谱记忆在小型推理模型中受到关注

Nautile-370M: Spectral Memory Meets Attention in a Small Reasoning Model

模型架构混合架构

摘要

我们推出了 Nautile-370M,这是一个 3.71 亿参数的小语言模型,专为在严格的参数和推理预算下进行高效推理而设计。 Nautile-370M 使用混合骨干网,其中两个 SeqCond Attention (SCA) 层(一种受 SeqCondenser 启发的线性时间谱序列算子)与一个 Transformer 层交替。该设计旨在保留结构化序列模型的长上下文效率和状态跟踪优势,同时保留表达性标记到标记的注意力路由。该模型在 Google TPU 研究云 (TRC) 计划提供的单个 Cloud TPU v4-64 pod 切片上进行训练;随后的强化学习阶段在单个 NVIDIA DGX Spark 上进行。我们证明 SCA 读出机制可以准确地从前缀摘要中检索任何单个标记,并且可以将 softmax 注意力的任何输出再现为特殊情况,从而证明 SCA 至少在连续限制下与完全自注意力一样具有表达能力。我们还描述了训练数据管道,并概述了专门用于推理、验证和响应质量的强化学习阶段。