论文

Prox:无需训练 通过 LLM 中的近似中间通道显着性实现 FFN 激活稀疏性

Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs

模型优化稀疏化

摘要

前馈网络 (FFN) 在 大语言模型 (LLM) 推理中主导内存流量和计算,使它们成为激活稀疏化的主要目标。然而,由于通道选择策略的限制,现有的 无需训练 方法在高稀疏性下模型质量会大幅下降。我们观察到 SwiGLU 中间状态提供了高效的通道选择信号,但获得它需要昂贵的密集计算。为了解决这个问题,我们提出了 \emph{Prox},一个用于稀疏 SwiGLU FFN 的两阶段 无需训练 框架。 Prox 取决于关键的见解:稀疏执行仅需要由中间状态引起的通道掩码,该通道掩码可以根据其条目的幅度排名而不是其确切值来构造。具体来说,第 1 阶段使用输入稀疏性和量化代理权重来构造共享掩码;第 2 阶段精确计算所选通道,从而实现所有三个投影的稀疏执行。在来自 6 个模型系列的 10 个 LLM 中,Prox 在所有稀疏度级别上都优于 无需训练 基线,在 70\% FFN 稀疏度下实现高达 1.99\times$ 的端到端解码加速,并且与量化和稀疏注意力兼容。