OScaR:LLM 及更高版本中用于极端 KV 缓存量化的奥卡姆剃刀
OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond
摘要
长上下文推理和多模态智能的快速发展使得键值(KV)缓存的内存占用成为高效部署的主要内存瓶颈。虽然所建立的每通道量化有效地适应了关键张量中固有的通道异常值,但其功效在极端压缩下会减弱。在这项工作中,我们从经验和理论的角度重新审视每通道量化范式的固有局限性。我们的分析将词元范数不平衡(TNI)确定为量化保真度的主要瓶颈。我们证明,当需要共享量化参数来跨越表现出巨大范数差异的标记组时,TNI 会系统性地放大误差。我们不依赖复杂的量化管道(例如 TurboQuant),而是提出 OScaR(Omni-Scaled Canalized Rotation),这是一种针对 X-LLM(即纯文本、多模态和全模态 LLM)的精确且轻量级的 KV 缓存压缩框架。 OScaR 推进了每通道范例,采用 Canalized Rotation 和 Omni-Token Scaling 来有效且高效地减轻 TNI 引起的序列维度方差,并得到我们优化的系统设计和 CUDA 内核的进一步支持。对 X-LLM 的广泛评估表明,OScaR 始终优于现有方法,并在 INT2 量化下实现了近乎无损的性能,将其确立为定义新 Pareto 前沿的稳健、低复杂性和通用框架。与 BF16 FlashDecoding-v2 基准相比,我们的 OScaR 实现在解码方面实现了高达 3.0 倍的显着加速,将内存占用减少了 5.3 倍,并将吞吐量提高了 4.1 倍。 OScaR 的代码可在 https://github.com/ZunhaiSu/OScaR-KV-Quant 上公开获取。