论文
TANGO:用于自然和形式语言建模的词元聚合非线性门算子
TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
摘要
标准 Transformer 块将自注意力中的跨词元交互与在每个位置独立应用的非线性前馈网络分开。我们引入了 TANGO 模型(词元聚合非线性门控算子),该模型用一个跨词元门控残差更新替换了这两个子层。每个源词元都会生成一个 SwiGLU 门向量。查询键相似性确定每个目的地的源门的加权平均值,并且生成的门重新调整投影的目的地特征。 TANGO 为每个因果可见源分配单独的权重,并且序列长度是二次的。 WANGO 模型(非线性门算子的窗口聚合)在最近的窗口内保留相同的非标准化分数,并对较旧的源使用正特征映射前缀统计,为固定窗口和特征维度提供线性序列长度复杂性。我们将 TANGO 和 WANGO 与 Recurrent 和 Untied Transformer++、全注意力 GAU 和 FLASH 进行比较。所有模型都有大约 4430 万个非嵌入参数,并在三轮匹配运行中进行训练。 TANGO、WANGO 和 Recurrent Transformer++ 应用一个共享块四次;其他架构使用四个独立的块。 TANGO 在 FineWeb-Edu、Lean 和 DeepMind Mathematics 上获得最低的平均验证负对数似然,尽管它具有最大的分析前向传递操作计数。 WANGO 在序列长度上具有线性计算的架构中获得了最低均值 FineWeb-Edu NLL,并且在几乎相同的分析前向乘法累加计数下优于循环 Transformer++。