论文
无残留 Transformer 的量化优势
The Quantization Benefits of Residual-Free Transformers
摘要
大规模 Transformer 训练和部署越来越受到跨加速器的激活、梯度和优化器状态传输的限制。低位量化提供了一种自然的补救措施,但 Transformer 激活通常是重尾且以异常值为主,使得简单的量化具有很高的损耗。我们表明,这种困难不仅是量化器的属性,也是架构的属性。具体来说,残余连接可以在训练期间驱动 Transformer 激活远离高斯性。通过对残差和无残差 Transformer 之间的受控比较,我们证明了这种效应会导致残差模型中低精度时的量化误差大幅增加和精度下降。我们通过过度峰度分析解释了这一现象,表明残差混合可以放大非高斯性,而无残差中的密集混合会收缩非高斯性。然后,我们证明可以使用正交初始化、谱或二阶优化以及注意力温度的深度感知缩放来训练无残差 Transformer。在语言任务中,虽然全精度性能略有下降,但这些模型保留了近高斯激活,并且对低位量化的鲁棒性显着提高。我们的结果确定了 Transformer 设计中的准确性与压缩性权衡,并激发了架构级方法来实现量化友好的基础模型。