论文
删除 LayerNorm 何时有帮助?激活边界作为依赖于机制的隐式正则化器
When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer
摘要
动态 Tanh (DyT) 通过用学习的 tanh(alpha x) 限制激活来移除 LayerNorm。我们证明这个边界是一个依赖于机制的隐式正则化器,而不是一个一致有益的替代。在涵盖 64M 至 3.78B 参数和 1M 至 118M 词元的 GPT-2 系列模型中,通过 Llama 和 ViT 交叉检查,DyT 在 64M/1M 时将验证损失改善了 27.3%,但在 64M/118M 时却使验证损失恶化了 18.8%; 1M 的好处随着容量的增加而消失(3.78B 时+1.7%),而 118M 的损失达到+27.9%。该机制是可测量的:49% 的 DyT 激活在 1M 时饱和,而在 118M 时为 23%,并且 500 步饱和启发式对 DyT 符号进行分类,在 12 细胞 GPT-2 校准集上以 75% 的原始样本内准确度(AUC 0.75;添加 Scale 5 压力细胞时为 64%),正确标记 3/3 Llama 检查,但仅达到50% 的原始留一横向扩展精度。三种干预措施支持有界解释:HardTanh 再现了政权模式,将 alpha 增加到 118M 单调减少了 DyT 的惩罚,而 vanilla+dropout(p=0.5) 匹配 DyT 的数据丰富的损失。我们还将 Llama-DyT 塌陷定位于 SwiGLU 门控,其中饱和度将 3 种子分量消融中的塌陷与收敛分开(r=0.94)。范围:所有实验均受计算限制(T/P < 1.84),低于龙猫最佳训练。