论文

QuantWM:用于世界模型和视频生成的时间一致的 2 位 KV 缓存量化

QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for World Models and Video Generation

摘要

KV 缓存已成为视频生成和世界模型的主要部署瓶颈,这激发了低位量化研究的效率。现有的 2 位 KV 缓存量化方法可以在 VBench 等视频基准上实现近乎无损的性能,但是我们发现它们仍然会导致严重的时间闪烁和视觉退化。同时,更深入的研究表明,关键量化产生的重建误差比值更小,但令人惊讶的是导致更大的输出退化。我们将这种差异追溯到注意力:小的关键扰动可以改变注意力logits,即 QK^\top,并移动查询选择的时空标记。这些观察结果促使我们在 KV 缓存量化期间明确保留注意力logits和时空标记选择,以缓解视觉退化问题。为了解决这个问题,我们提出了 QuantWM,一个免训练且严格因果的 2 位 KV 缓存量化框架。 QuantWM 引入了两种互补技术来减轻注意力转移。首先,量化敏感度感知聚类(QSAC)联合考虑历史查询敏感度和残差范围来选择INT2友好的关键质心,这减少了对关注更关键的通道中的量化误差。此外,主子空间注意力补偿(PSAC)使用低秩投影恢复占主导的查询子空间的剩余关键错误,这提供了直接有效的校正来稳定注意力logits。对 Causal-Forcing、LingBot-World-v2、HY-World 1.5、Matrix-Game-2 和 Longcat-Video 的大量实验表明,QuantWM 显着提高了视觉质量和时间一致性,同时在图像和视频质量指标方面优于现有方法,具有高达 6.20 倍的 KV 缓存内存压缩和有限的额外开销。