论文

CascadeFormer:由梯度扇入不对称性驱动的深度锥形 Transformer

CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry

模型架构Transformer

摘要

深层 Transformer 由均匀堆叠的残差块组成,但它们的最深层通常增加的价值很少。我们提出了两种利用这种不对称性的效率方法。 CascadeFormer 随着深度逐渐减小宽度,以匹配跨层不均匀的信息流,在相同的训练预算下实现与统一基线相当的困惑度,同时将延迟减少 8.6%,吞吐量增加 9.4%。 CascadeFlow 修剪使用累积的训练梯度来删除层,无需事后分析。它在复杂性和排名稳定性方面优于标准启发式方法,并在下游准确性方面保持竞争力。为了激励这些方法,我们提出梯度扇入不对称(GFA)作为为什么更深层贡献较少的结构解释。在 Pre-LayerNorm 残差堆栈中,一层的梯度是恒等路径和所有下游功能路径的总和,产生随深度线性衰减(在深度监督下二次衰减)的梯度扇入,为早期层产生更丰富的梯度,为后面层产生更稀疏的梯度。我们为从头开始训练到 1.2B 参数的模型提供 GFA 的相关和干预证据。在 Transformer 和 ResNet 中,累积的训练梯度遵循理论扇入,并与事后层重要性相关。两种干预措施指出结构而不是幅度是瓶颈:均衡每层梯度范数不会恢复后期层的价值,而通过参数共享重复增加下游路径计数可以恢复并提升它。梯度幅度是否代表超出高阶范围的扇入,以及这些动态在 100B+ 尺度上的表现如何,仍然是悬而未决的问题。