论文

Forcing-KV:用于高效自回归视频扩散模型的混合 KV 缓存压缩

Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

模型推理KV Cache

摘要

自回归 (AR) 视频扩散模型采用流式生成框架,能够生成具有实时响应能力的长视野视频,如自强迫训练范例所示。然而,由于跨历史帧的冗余键值(KV)缓存,现有的 AR 视频扩散模型仍然面临着显着的注意力复杂性和严重的内存开销,这限制了可扩展性。在本文中,我们通过将 KV 缓存压缩引入自回归视频扩散来应对这一挑战。我们观察到主流 AR 扩散模型中的注意力头表现出明显不同的注意力模式和功能角色,并且在样本和去噪步骤中保持稳定。基于我们对头功能专业化的实证研究,我们将注意力头分为两类:静态头(专注于自回归块和帧内保真度之间的转换)和动态头(控制帧间运动和一致性)。然后,我们提出了 Forcing-KV,一种混合​​ KV 缓存压缩策略,它对静态头执行结构化静态剪枝,对动态头执行基于分段相似性的动态剪枝。在保持输出质量的同时,我们的方法在单个 NVIDIA H200 GPU 上实现了每秒超过 29 帧的生成速度,同时缓存内存减少了 30%,在 480P 分辨率下为 LongLive 和 Self Forcing 提供高达 1.35 倍和 1.50 倍的加速,并在 1080P 分辨率下进一步扩展到 2.82 倍加速。 https://zju-jiyi Cheng.github.io/Forcing-KV-Page 提供了代码和演示视频。