论文
PrunePath:走向高度结构化的稀疏语言模型
PrunePath: Towards Highly Structured Sparse Language Models
摘要
前馈网络(FFN)主导着现代语言模型的参数计数和计算,但现有的修剪方法通常难以将稀疏性转化为硬件友好的推理效率增益。我们引入了 \textbf{PrunePath},一种用于 FFN 层的预算自适应结构化稀疏框架。 PrunePath 建立在 MoEfication 的基础上,用 softmax 归一化路由分布取代了独立的专家阈值处理,并在累积质量阈值下激活重要的专家。该公式强加了 词元级 概率预算,从而实现自适应专家计数和来自单个检查点的直接推理时间稀疏性旋钮。在 NLU、NLG 和指令调优评估中,与现有的静态剪枝和基于 MoEfication 的方法相比,PrunePath 实现了良好的稀疏性与性能权衡。我们进一步实现了用于 KV 缓存解码的 Triton 内核,将由此产生的结构化稀疏性转化为实际的内存节省和可测量的解码速度改进。这些结果证明了 PrunePath 在构建高度稀疏、部署友好的 大语言模型 方面具有卓越的性能。