论文

HeatKV:用于视觉自回归建模的 Head-tuned KV 缓存压缩

HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling

模型推理KV Cache

摘要

视觉自回归 (VAR) 模型最近展示了令人印象深刻的图像生成质量,同时保持了低延迟。然而,它们受到严重的 KV 缓存内存限制,每个生成的图像通常需要 GB 的内存。我们引入了 HeatKV,一种新颖的压缩方法,它根据对先前生成的尺度的关注来调整每个头中的缓存分配。使用小型离线校准集,根据先前尺度的注意力得分对注意力头进行排名。根据这个排名,我们构建了一个适合给定内存预算的静态修剪计划。应用于 Infinity-2B 模型时,与现有方法相比,HeatKV 在 KV 缓存的内存分配方面实现了高出 2 倍的压缩比,同时保持相似或更好的图像保真度、提示对齐和人类感知得分。我们的方法实现了 VAR 模型 KV 缓存压缩的最新技术 (SOTA),展示了细粒度、特定于头的缓存分配的有效性。代码和校准脚本可在 https://github.com/arm-research/heatkv 获取。