论文

HeadGuard:低位 VLM KV 缓存量化的选择性磁头保护

HeadGuard: Selective Head Protection for Low-Bit VLM KV-Cache Quantization

摘要

低位键值 (KV) 缓存量化可以节省存储空间,但会急剧降低视觉语言模型 (VLM) 的准确性。我们引入了 HeadGuard,这是一种可组合的头部保护方法,它通过固定的高精度掩模增强了基础 KV 缓存量化器。图像敏感度和输出敏感度分数选择物理KV头离线,主要实验中大约1/8受到保护;它们的图像键和可选值保留在 bfloat16 (BF16) 中,而基数则量化未受保护的图像条目。在八个 VLM、三个基本量化器和八个基准测试(六个判别式和两个生成式)中,HeadGuard 恢复了较弱量化器上损失的大部分精度,其中 Qwen 和 InternVL 的增益最为强劲。在 2 位时,八个模型的六任务判别平均值在最弱的基础上从 0.436 上升到 0.580;保护还可以提高生成的答案和字幕对 BF16 输出的保真度。使用两个经过测试的校准数据集,所有三个量化器的平均精度增益均保持不变。仅密钥保护可以以较低的建模存储成本保留大量恢复。通过模拟量化进行评估,HeadGuard 提供了一种可组合的方法来提高低位 VLM 精度,而无需更换底层量化器。