论文
LayerRoPE:随网络深度变化的幅值与角度调节
LayerRoPE: Dynamic Depth-wise Magnitude & Angular Superposition
摘要
数据在Transformer中传播时,隐藏状态的范数会随深度增长数个数量级。这一现象被称为“深度诅咒”,几乎普遍被当作需要抑制的问题。我们提出相反的看法。对9个模型家族的16个预训练LLM进行分析,覆盖稠密、MoE和混合架构以及Pre-Norm、Peri-Norm和Post-Norm设计,发现这种增长反映了涌现的深度位置编码。它由残差流上唯一可学习的逐层增益——归一化权重γ——承载:γ的幅值随深度增长,方向也随之旋转,二者共同编码层索引。我们用LayerRoPE显式表示这种深度条件编码。它类似沿深度轴的隐式RoPE,以一个共享向量和深度相关标量替代所有逐层γ向量,净减少参数,FLOPs变化小于0.02%。在训练规模扩展到超过1000亿Token的模型系列中,LayerRoPE持续优于Pre-Norm、Post-Norm、Peri-Norm和Layer-Norm Scaling,以约1/3.4的计算量达到Pre-Norm的1.3B模型损失水平。当深度增加到512层时,它是唯一保持强收敛并取得近乎单调改善的方法。它将学习率敏感性改善3—10倍,并可直接迁移到循环潜变量模型和视觉Transformer,持续改善其表现。对学得调节规律的检查推翻了常见前提:LayerRoPE并不缩小残差流,而是扩大它,同时抑制每个模块读取的信号并放大写入信号。结果表明,深层模型的稳定性需要按深度调节残差流所驱动的计算模块,而非直接抑制残差流。
