LayerNorm Transformer 中的代数死方向:LLM 规模的仅前向传递诊断
Algebraic Dead Directions in LayerNorm Transformers: A Forward-Pass-Only Diagnostic at LLM Scale
摘要
预训练的 Transformer 位于损失的奇异最小值附近,其中费舍尔信息度量沿着死方向退化:参数空间中的方向,定向费舍尔沿着这些方向消失。定位这样的方向通常需要前向传播和激活的特征分解,或基于采样的复杂性估计; none 返回可单独根据网络参数计算的方向。我们给出一个 LayerNorm Transformer。对于任何输入分布,LayerNorm 仿射的反尺度方向 $γ^{-1}/\|γ^{-1}\|$ 是后最终范数中心激活协方差的精确代数核,并在参数空间中引入相应的死方向。它仅从 LN 比例参数读取,没有前向或后向传递,也没有特征值求解:最便宜的死方向读取,特定于 LayerNorm。我们在 $14$ 预训练的 Transformer 上进行测试($9$ LayerNorm,$5$ RMSNorm;$160$M-$35$B;语言和视觉目标)。在随机初始化时,预测方向在 $9/9$ LayerNorm 模型上与测量的底部奇异方向(一次前向传递,直接 SVD)匹配到小数点后四位,并且在 $5/5$ RMSNorm 模型上正确地不存在,该模型缺少创建它的均值减法投影仪。在经过训练的检查点上,沿该方向的协方差特征值加深 ${\sim}10^3\times$ 并且进一步打开死方向;随机初始到训练的间隙是沿着预测坐标的奇异结构的一次前向传递、每个检查点读数。以封闭形式得出两个结果:残差流的最小奇异值在 $13/14$ Transformer 上逐块保留,在其自己的输入分布上测量,一个例外 (Gemma$4$-$31$B) 是一个真正的死方向,相同的读取精确点;内核方向的存在仅根据参数对 Transformer 的归一化进行分类。