论文
压缩重要内容:神经元重要性满足语言模型压缩的数据感知低秩近似
Compressing What Matters: Neuron Importance Meets Data-Aware Low Rank Approximation for Language Model Compression
摘要
为了在其领域表现出色,大语言模型 由数十亿个参数组成。然而,这是以巨大的内存需求为代价的,限制了它们在资源有限的环境中的适用性。为了解决神经网络 (NN) 压缩问题,奇异值分解 (SVD) 作为通过分解进行矩阵压缩的基本组件发挥了关键作用。为了最小化压缩误差并最大化压缩模型对下游任务的功效,以前的工作从参数重要性或每层功能等价的角度集中于神经网络权重矩阵的低秩近似。虽然之前的工作单独研究了上述观点,但在这项工作中,我们正在研究将这两个观点的想法结合到一个目标中的方法的有效性。与此同时,影响压缩质量的一个重要方面是压缩率跨层和神经网络参数的分布。早期的工作主要考虑跨层和网络权重均匀分布压缩率,或者依赖于计算成本昂贵的启发式搜索。与此相反,在这项工作中,我们提出了一种用于动态压缩率分配的增强且计算高效的算法。实验结果支持所提出的方法的有效性,该方法的性能与以前的最先进技术相当或明显更好,特别是在高压缩比下。