论文

KVarN:方差归一化 KV 缓存量化可减轻推理任务中的错误累积

KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks

模型推理KV Cache

摘要

测试时间缩放是在 大语言模型 中获得更好推理的强大方法,但随着 KV 缓存的增长,它在长范围解码期间会成为内存瓶颈。 KV 缓存量化可以帮助改善这一点,但当前的方法是在类似预填充的设置下进行评估的,并且在自回归解码下错误的行为有所不同。我们表明,在后一种情况下,量化误差会在时间步长内累积,这主要是由不正确的词元比例驱动的。我们引入了 KVarN,这是一种免校准的 KV 缓存量化器,它应用 Hadamard 旋转,然后在 K 和 V 矩阵的两个轴上进行双尺度方差归一化。我们发现这种组合修复了外围词元规模错误,并大大减少了现有基线上的错误累积。 KVarN 在生成基准(包括 MATH500、AIME24 和 HumanEval)上以 2 位精度建立了新的最先进的 KV 缓存量化。 KVarN 方法的 vLLM 实现请参见 https://github.com/huawei-csl/KVarN