论文
更具表现力的前馈层:第一部分:词元自适应激活混合
More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations
摘要
前馈网络 (FFN) 层在基于 Transformer 的 大语言模型 (LLM) 中占很大一部分参数和非线性表达能力。尽管从 ReLU 和 GELU 发展到 SwiGLU 等门控变体,但大多数 FFN 设计仍然使用单个固定激活函数,对所有词元应用相同的非线性变换。在这项工作中,我们提出了激活混合(MoA),这是一种词元自适应 FFN 设计,它使用轻量级输入相关门混合激活函数字典,同时共享相同的线性投影。作为与输入无关的对应物,我们还引入了可学习激活(LA),它形成 ReLU 型和 SwiGLU 型 FFN 激活函数的线性组合。理论上,我们在固定激活 FFN、LA 和 MoA 之间建立严格的有限宽度表达分离:LA 严格包含固定激活 FFN,而 MoA 严格包含 LA,并具有由输入相关的非线性杂交产生的额外表达性。根据经验,我们通过在不同的 词元预算、优化器和学习率计划下对从 0.12B 到 2B 参数范围的密集和 MoE 语言模型进行广泛的 预训练 实验来评估 MoA。 MoA 始终以最小的参数和计算开销实现较低的终端损耗,并比精心调整的基线表现出更有利的缩放行为。这些结果表明,词元自适应激活混合是提高 LLM 中 FFN 表达能力的简单而有效的机制。