论文
DensityKV:用于长视频生成的密度引导 KV 缓存压缩
DensityKV: Density-Guided KV Cache Compression for Long Video Generation
摘要
自回归视频扩散模型通过滑动窗口注意力实现流生成,但每个生成的块都以先前生成的内容为条件,导致外观和运动误差随着时间的推移递归传播。历史键值 (KV) 内存保留早期的主体和场景状态,并有助于保持长期一致性。然而,保留每个生成的状态会创建一个历史档案,该档案会随着生成轨迹而不断增长,而循环状态会不断增加冗余覆盖范围。为了解决这个问题,我们提出了 DensityKV,一种 无需训练 历史KV库管理策略。 DensityKV 为每个注意力头维护一个单独的 词元级 KV 库,并测量使用 Soft-Riesz 密度直接参数化注意力路由的 post-RoPE 键之间的局部冗余。通过在状态进入存储库后限制邻域密度的增长,DensityKV 限制了重复的历史积累,同时保留了每个已完成的生成块的相干状态。跨三个自回归视频生成主干和多个生成长度的实验表明,在历史 KV 容量的上限相同的情况下,DensityKV 提高了长范围一致性和生成稳定性,同时保持持久历史存储范围独立于生成轨迹长度。