论文
为什么后规范 Transformer 崩溃:注意力放大和梯度修复失败
Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure
摘要
仅深度解码器 Transformer 通常用 Pre-Norm 变体替换原始的 Post-Norm 架构,因为 Post-Norm 训练对传统初始化方案下的预热和学习率高度敏感。尽管之前的工作已将排名崩溃和梯度消失确定为相关症状,但人们仍然对因果注意力如何创建高相似性表示以及为什么训练动态无法修复它们知之甚少。我们使用标记相似度作为标量状态变量,对后规范排名崩溃进行两阶段分析。首先,在初始化时,因果注意力近似充当前缀平均算子,增加深度上的标记相似性,而 SwiGLU 分支仅贡献较小的阻尼效应。其次,一旦训练进入高相似度状态,预归一化残差范数的增长会使 RMSNorm 后向因子收缩;在温和的条件下,早期层的梯度呈几何衰减。作为补充结果,我们描述了折叠网络的属性:其最佳预测因子是具有相对较高损失层的频率分布,并且折叠层中的梯度在频率分布处消失。在 C4 数据集上训练的仅 48 层解码器 Transformer 上的实验与预测的初始化时间相似性增长和崩溃时间梯度收缩相匹配,并表明崩溃运行保持在预测的频率损失附近。总之,这些结果区分了后规范崩溃中的前向相似性放大和后向修复能力,同时也表征了崩溃网络的行为。