论文

AutoNorm:通过可微门控了解 Transformer 中的自适应标准化

AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating

模型架构Transformer

摘要

归一化是稳定 Transformer 训练的关键组成部分,但层归一化 (LN) 等静态策略和自适应替代方案之间的选择在很大程度上仍然取决于任务。在本文中,我们研究了可微归一化门控中的关键优化挑战。我们的实验表明,在相对平稳的视觉任务中,Gumbel-Softmax 门控引入的高梯度方差会阻碍路由机制的收敛,导致学习门的性能低于简单的随机选择。相比之下,在非平稳语言建模和分类任务中,持续的门控多样性使模型能够学习更有效的逐层标准化策略。受这些观察的启发,我们提出了 AutoNorm-S(稳定),这是一种通过门冻结计划减轻优化不稳定性的训练策略。 AutoNorm-S 在多个基准测试中实现了具有竞争力或改进的性能,优于 NLP 数据集(包括 PTB 和 SST-2)上的自适应标准化基线,同时在标准视觉基准测试上保持竞争力。这些结果表明,将归一化选择与优化噪声解耦,为 Transformer 架构中的自适应归一化提供了一种实用且有原则的方法。