论文

QuantaSpike:大语言模型的短窗口尖峰驱动量化

QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

摘要

大语言模型 (LLM) 在许多任务中实现了强大的性能,但在推理过程中依赖于密集的乘法累加 (MAC) 运算,导致能源成本较高。尖峰神经网络 (SNN) 提供了一种事件驱动的替代方案,其中突触集成使用轻量级积累。然而,尖峰驱动的 LLM 推理仍然很困难,因为异常值重的激活通常需要长触发窗口或辅助非尖峰路径。我们提出了 QuantaSpike,一种围绕对数三元积分激发 (LTIF) 神经元构建的 LLM 短窗口尖峰驱动量化框架。 LTIF 使用具有二次方膜响应量子的三元事件,改进了每个激发步骤所表示的信息,同时保留了移位 ACC 兼容的计算。 QuantaSpike 将此神经元与组自适应增益和选择性异常值接纳相结合:正常值使用残余 LTIF 步长,而接纳的异常值在进入相同的残余动态之前会收到一个额外的起始尖峰。在 OPT 和 Llama-2 中,QuantaSpike 在尖峰驱动的 LLM 量化方法中实现了最先进的或有竞争力的困惑度和零样本精度。它还转移到更新的密集 LLM,在相同的四步激发窗口下保持接近 Llama-3-8B 和 Qwen3-8B 上的 FP16 参考。分析线性能量预测表明,相对于 SpikeQuant,QuantaSpike 在 OPT 模型上将一次线性变换的能量减少了约 $80.0\%$,在 Llama-2 模型上减少了约 $67.1\%$,为 LLM 推理提供了一种准确且节能的尖峰驱动路径。