论文
VideoMLA:用于分钟级自回归视频扩散的低秩潜在 KV 缓存
VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
摘要
长期轨迹采样的因果视频扩散已经集中在固定大小的滑动窗口 KV 缓存上,最近的进展是通过改变哪些词元占据窗口或它们的位置如何编码来在这种布局中进行创新。每个头的 KV 布局本身是流内存和延迟的主要贡献者,但基本上保持不变。在本文中,我们提出了视频扩散中多头潜在注意力(MLA)的第一个研究。 VideoMLA 使用共享的低秩潜在内容和共享的解耦 3D-RoPE 位置密钥替换每个头的密钥和值,从而将每个缓存层的每个词元 KV 内存减少 92.7%。我们进一步研究了为什么 MLA 在视频扩散方面取得了成功,尽管在语言模型中经常用于激励它的谱假设并不成立:预训练的视频注意力不是低秩的,99% 的能量有效秩远远高于任何实际的潜在维度。 VideoMLA 在压缩比下保持质量,其中直接谱近似会预测较大的重建误差。我们表明,MLA 瓶颈,而不是预训练谱,决定了有效秩:谱初始化和随机初始化几乎占据了初始化的满秩预算,并且训练在适应时保留了该预算。在 VBench 上,VideoMLA 匹配短视距流视频扩散基线,在评估的方法中在长视距上实现了最佳总体得分,并将单个 B200 上的吞吐量提高了 1.23 倍。