论文

面向延迟与模型大小优化的LLM多目标结构化剪枝

Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization

摘要

大语言模型(LLM)凭借强大的推理与问答能力获得广泛采用。然而,由于严格的延迟、内存和能耗约束,将它们部署到嵌入式与边缘计算环境仍然充满挑战。庞大的参数量与计算需求阻碍了其在资源受限平台上的高效执行。尽管模型剪枝已成为在保持性能的同时缩减规模的可行方案,但联合优化层、注意力头和多层感知机(MLP)维度仍然极为复杂。穷举探索这一组合设计空间计算代价高昂,且常导致局部最优或不稳定的配置。为解决这些局限,我们提出一个硬件感知的多目标结构化剪枝框架。所提出的两阶段方法显式以延迟和模型大小为目标,以实现边缘设备的高效部署。在粗粒度阶段,多目标深度剪枝移除整个注意力和MLP块,以降低计算负载和内存占用。在随后的细粒度阶段,并行贝叶斯优化(PBO)在延迟约束下搜索最优的逐层剪枝率,而基于重要性的策略则在各层分配的预算内对要剪枝的具体组件进行排序。实验结果表明,我们的方法在尽量少影响常识推理任务和零样本性能的前提下降低模型复杂度。该方法在准确率、延迟和模型大小之间取得良好折中,适合边缘部署。在多个LLM的37.5%和50%剪枝率下,该方法在常识推理任务上取得优于现有方法的性能,同时显著降低推理成本。

面向延迟与模型大小优化的LLM多目标结构化剪枝:论文配图
图 1:所提出的多目标结构化剪枝框架概述,该框架将 LLM 压缩的完整工作流程与用于延迟和模型大小感知优化的两阶段粗到精剪枝过程相结合。