论文
强调问题:为什么 Softpick 在初始化时失败
Underscoring the Problem: Why Softpick Fails at Initialization
摘要
Softmax 注意力为每个token赋予非零权重,在经过训练的模型中,该权重集中于注意力池和大量激活,从而扩大了低精度推理必须覆盖的动态范围。 Softpick 通过纠正分数、消除汇点和降低隐藏状态峰度来消除这一限制,但其优势随着规模的扩大而逐渐减弱。我们将这种失败重新定义为标准化问题。 Softpick 的分母分为正移和负移和 $D^+$ 和 $D^-$,在前向和后向传递中使用相同,防止它们的角色被孤立。我们将它们分成一系列独立选择每个分母的运算符。失败源于初始化:每一层都包含 $D^+$ 恰好为零的行,而无论后向分母如何,近乎死亡的行都会产生高于 $10^{12}$ 的梯度范数。只有 Softpick 和 stop-梯度变体(使 $D^+ + D^-$ 保持向前,但仅通过 $D^+$ 反向传播)从头开始训练。在 230M 参数处,stop-梯度运算符在量化方面与 Softpick 相匹配,死头更少,并且更可靠地检索密钥,仅在峰值注意力权重峰度上落后。