论文
SLORR:简单高效的训练中低秩正则化
SLORR: Simple and Efficient In-Training Low-Rank Regularization
摘要
低秩分解广泛用于压缩神经网络,但现代模型通常无法自然地适应激进的分解而不造成显着的准确性损失。现有的训练时低秩正则化器可以提高可压缩性,但它们通常需要大型权重矩阵的 SVD、修改模型架构(引入额外的可训练参数)或依赖有状态的缓存量。为了解决这些限制,我们引入了 SLORR,这是一种简单、无状态且保留架构的框架,用于训练中的低秩正则化,并使用基于 Hoyer 稀疏度度量和核范数的两个主要变体进行实例化。 SLORR 使用 GPU 友好的近似值直接正则化原始权重矩阵,用于正则化器的前向和后向传递,为此我们提供近似保证。我们首先在 ResNet-50、ViT-B/16 和 ViT-L/16 的短期持续训练以及 ResNet-18 的预训练中评估 ImageNet-1K 上的 SLORR,其中 SLORR 引入了可压缩性,同时引入了不到 8% 的训练开销。我们进一步在 135M 和 560M 规模的 LLM 预训练中评估 SLORR-Hoyer:SLORR 训练的压缩模型比非正则化模型保持了更好的性能,同时增加了不到 1% 的平均训练开销。