论文

SemKV:长上下文 LLM 推理的质量悬崖引导的语义混合精度 KV 缓存量化

SemKV: Semantic Mixed-Precision KV Cache Quantization Guided by the Quality Cliff for Long-Context LLM Inference

模型推理KV Cache

摘要

键值 (KV) 缓存是长上下文 大语言模型 (LLM) 推理的主要内存瓶颈,随着上下文长度线性增长。我们表明,分数位网格上的均匀 KV 量化不会优雅地降级:在预先指定的多种子统计协议下,具有仿射量化器的 Llama-3.1-8B-Instruct 在统计上与 FP16 KV 低至 2.322 代码位/值无法区分,并在 2.0 位处崩溃 - (2.0, 2.322] 中的质量悬崖,再次出现在生成时量化和多轮对话并传输到 Mistral-7B。悬崖重新构建了重要性感知混合精度:在其之上,八个模型内部重要性指标在统计上是可互换的,因此混合的好处是网格插值,达到平均精度,SemKV 无法实现均匀量化保留每个标记,按模型内部分数对标记进行排名,并分配两个相邻的悬崖上方精度,实现了测量的 6.0 倍存储减少,而统计上无法检测到。与完整 KV(n=900,三个种子)的质量差异以及优于 FP16 词元修剪的内存预算增加了 1.5 倍,用失真优化量化器 (TurboQuant-MSE) 替换仿射基可以降低每个测试协议中的悬崖,将不可检测的损失操作点提高到 7.9 倍。 秘诀:测量目标部署设置的悬崖,然后在其之上进行插值。