论文
LLM 中的大量尖峰是偏差向量:机制揭示和无尖峰量化
Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization
摘要
大语言模型 (LLM) 中的大量激活尖峰通过拉伸动态范围严重降低了量化性能。虽然先前的假设将这些描述为高级标量偏差,但我们认为它们仅仅是带有尖峰的标记中刚性的结构向量偏差的标量中间体。我们表明,这些标记在归一化后收敛为常数向量,驱动注意力池和价值状态消耗机制。我们通过分析投影权重的协调在几何上证实了这一点:$W_K$ 对比放大了向量,$W_Q$ 将语义标记与其对齐,$W_V$ 将其投影到光谱零空间中。此外,我们还发现,该模型通过利用低频段和相干通道对将这些结构偏差定位在“旋转稳定区域”,从而主动保留这些结构偏差以防止旋转位置嵌入(RoPE)扰动。利用这一点,我们提出了 INSERTQUANT,这是一个 后训练 量化 (PTQ) 框架,它可以钳制尖峰并通过预先计算的模板向量恢复其功能。这使得激活严格无尖峰,从而实现具有高保真度的鲁棒低位量化。 INSERTQUANT 在 LLM 上实现了与最先进的每张量量化方法的同等性,并且独特地将文本范围推广到 ViT 等其他模态。