论文

KV 缓存量化下的对齐崩溃:诊断和缓解

Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

模型评测安全与风险评测

摘要

键值(KV)缓存量化被广泛用于减少大语言模型(LLM)推理内存,但现有的评估仅侧重于测量复杂度和准确性,而没有评估安全影响。在本研究中,我们探索了 KV 缓存量化下的对齐保留。在 11 个指令调整模型 (3.8B-72B) 和 5 个基准测试(1,894 个提示)中,我们发现低位量化可以悄无声息地破坏安全对齐:Mistral-7B 在仅 1.03 倍的困惑度下就失去了 15.2% 的拒绝,并且不存在通用的安全位宽,并且特定于模型的尖锐相变对于标准指标来说是不可见的。我们发现根本原因是几何性的:安全特征占据的低维激活子空间比完整表示空间的困惑度平均值更容易受到量化噪声的影响 10^2-10^3 倍。受这一观察的启发,我们提出了每通道减少(PCR),这是一种将每个模型分类为三种机械故障模式之一的诊断方法:异常值-崩溃-安全性,其中安全性存在于非异常值通道中,受到异常值驱动的比例因子的附带损害;离群值即安全性,其中安全性与离群值通道重叠,并且更细的粒度无法挽救它;以及多层稀释,其中安全性分布在多个层上,并且每层修复都会失败。 PCR 使用 20 个校准提示预测所有 9 个主要模型和来自独立系列的一个保留模型的正确缓解方向。 PCR 可以推广到看不见的提示、模型和生产量化器,包括 KIVI,其恢复率高达 97.2%,在基于注意力的分配方法失败的地方取得了成功。由此产生的 无需训练 协议需要大约 35 GPU 分钟,以最小的内存开销恢复高达 97% 的丢失对齐,解决了在 NVIDIA GPU 上使用 FP8 KV 缓存提供的生产 vLLM 服务中确认的漏洞。