论文

WindowQuant:基于窗口级相似性的混合精度 KV 缓存量化,用于 VLM 推理优化

WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization

模型推理KV Cache

摘要

近年来,视频语言模型(VLM)已应用于各个领域。然而,VLM的视觉词元序列太长,这可能会导致无法容忍的推理延迟和GPU内存使用。现有方法提出基于词元粒度对VLM中的键值(KV)缓存进行混合精度量化,这在搜索过程中非常耗时,并且在计算过程中硬件效率低下。本文介绍了一种称为 WindowQuant 的新颖方法,该方法采用窗口自适应混合精度量化来优化 KV 缓存。 WindowQuant由两个模块组成:窗口级量化搜索和窗口级KV缓存计算。窗口级量化搜索根据相应视觉标记窗口与文本提示之间的相似度分数快速确定KV缓存窗口的最佳位宽配置,保持模型准确性。此外,窗口级KV缓存计算在量化之前对KV缓存窗口进行重新排序,避免了推理计算中混合精度量化导致的硬件效率低下。大量实验表明,WindowQuant 在各种数据集上的性能优于最先进的 VLM 模型和 KV 缓存量化方法。