论文
Nexusformer:用于稳定和可遗传的非线性注意力扩展 Transformer 缩放
Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling
摘要
扩展 Transformer 通常需要从头开始训练更大的模型,因为标准架构很难在不丢弃学习表示的情况下进行扩展。我们确定了注意力机制线性投影的主要瓶颈,它严格将特征提取限制在固定维度的子空间,限制了表达能力和增量容量。为了解决这个问题,我们引入了 Nexusformer,它用 Nexus-Rank 层取代了线性 $Q/K/V$ 投影,Nexus-Rank 层是由逐渐更高维度空间中的双重激活驱动的三阶段非线性映射。这种设计克服了线性约束并实现无损结构化增长:可以通过保留预训练知识的零初始化块沿两个轴注入新容量。语言建模和推理基准测试表明,Nexusformer 在渐进式扩展(240M 到 440M)期间使用最多 41.5% 的训练计算量减少了 41.5%,与 Tokenformer 的困惑度相匹配。此外,我们对增长动力学的分析表明,零初始化会产生稳定的收敛轨迹,使我们能够导出几何缩放定律,准确预测跨扩展尺度的性能。