论文

DiBA:神经网络权重压缩的对角线和二元矩阵近似

DiBA: Diagonal and Binary Matrix Approximation for Neural Network Weight Compression

模型优化模型压缩

摘要

在本文中,我们提出了 DiBA(对角线和二元矩阵近似),一种用于神经网络权重压缩的紧凑矩阵分解。现代网络的许多组件,包括线性层、$1\times1$ 卷积、注意力投影和嵌入层,都具有密集的矩阵权重。 DiBA 通过 $\widehat A=D_1B_1D_2B_2D_3$ 近似 $A\in\mathbb{R}^{m\times n}$,其中 $D_1,D_2,D_3$ 是对角矩阵,$B_1,B_2$ 是 $0/1$ 二进制矩阵。中间维度$k$控制理论存储和近似精度之间的权衡。对于矩阵向量乘积,DiBA 将密集乘法分解为三个逐元素缩放操作和两个二进制混合操作,将浮点乘法计数从 $mn$ 减少到 $m+k+n$。为了优化,我们引入了 DiBA-Greedy,这是一种交替求解器,它将对角因子的闭式最小二乘更新与二元因子的精确一位改进测试相结合。我们还引入了 DiBARD(仅重新调整对角线因子的 DiBA),它用 DiBA 因子替换密集矩阵层,冻结二进制矩阵,并仅重新调整下游数据的对角线条目。这保留了紧凑的二进制混合,而无需在适应期间进行离散搜索。在从公共预训练模型中提取的 40 个密集权重矩阵上,随着理论存储比率的增加,DiBA-Greedy 产生了一致的 SNR 改进。在两项组件替换研究中替换 DiBA 后,DiBARD 将 DistilBERT/WikiText 屏蔽标记的准确性从 0.4447 提高到 0.5210,并且语音命令测试音频频谱图 Transformer 的准确性从 0.7684 提高到 0.9781,而无需重新优化二进制因子。