论文
用于全连接层稳定结构化稀疏化的分层解耦
Layerwise Decoupling for Stable Structured Sparsification of Fully Connected Layers
摘要
我们提出了一种解耦的分层方法,用于在结构上稀疏预训练神经网络的全连接层。我们的方法不是联合惩罚所有层,而是提取浅层两层子网络,标准化内部权重,并对每个块的外部权重矩阵应用结构化组惩罚,顺序处理层以修剪神经元并减少每层的宽度。我们证明,对于任何正均匀激活,约束解耦目标在最优性上相当于内部和外部权重上的特定联合惩罚,因此允许干净的投影和近端公式。我们的主要发现是,这种解耦的重新表述比耦合的方法更稳健。在数值实验中,与测试的联合基线相比,它提供了更广泛的可用正则化强度范围和更低的灾难性过度修剪率,同时保持了相当的精度。我们在受控分类和稀疏恢复研究中建立了这些属性,并在高维 PINN 压力测试和 OPT-1.3B 的前馈层中检查了它们的范围。