论文
大型语言模型的相关感知结构化剪枝
Correlation-Aware Structured Pruning for Large Language Models
摘要
结构化剪枝是一种很有前景的方法,可以在保持硬件效率的同时降低大型语言模型 (LLM) 的大量推理成本。许多现有方法单独评估可剪枝单元(例如通道或头)的重要性,隐含地假设剪枝误差是可加的。这种独立性假设通常会因模型权重的非正交性和单元激活之间的强相关性而失效,从而可能导致性能下降。为了解决这个问题,我们提出了一种相关感知结构化剪枝方法。我们将修剪目标制定为基数约束的二元二次程序,它显式地模拟重建误差中的跨单元依赖性。由于这个二元二次规划是 NP 困难且难以精确求解,因此我们开发了一种基于依赖感知边际成本的贪婪交互算法来优化单元选择。此外,我们采用基于梯度的策略来实现整个模型的自适应分层稀疏分配。对主流大语言模型的广泛实验表明,与代表性的结构化修剪基线相比,合并相关信息可以产生有竞争力的准确性-效率权衡。