论文

SpAx:激活稀疏+权重近似加速卸载解码

Activation Sparsity with Weight Approximation for Faster LLM Decoding on Offloaded Weights

模型推理推理加速

摘要

在显存不足以容纳权重的消费级GPU上部署LLM会导致极慢推理:解码反复把卸载权重从系统内存或闪存以远低于本地显存的带宽搬入GPU。激活稀疏通过跳过与零或近零激活关联的权重减少搬运,但随着省略更多激活贡献,模型质量最终快速退化,说明与小幅值激活关联的权重共同地急剧影响模型质量。本文改善利用激活稀疏时的质量-解码性能权衡,核心思想是把"读或不读权重"的二元选择换成三选项:完整保留、用压缩权重表示近似、或完全省略。SpAx跳过激活最接近零的权重,对小幅值激活读近似权重,对最大幅值激活读原权重:小幅值激活会衰减近似权重引入的误差,而压缩权重表示需传输的字节更少。权重卸载到CPU内存时,SpAx使16位权重解码平均加速3.86倍(至多5.57倍)、4位权重2.06倍(至多2.74倍),WikiText-2困惑度至多增加10%;卸载到闪存时加速分别为3.31倍(至多4.81倍)与1.54倍(至多2.03倍)。