SQuad:次二次注意力 蒸馏 用于高效视频生成
SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation
摘要
视频扩散 Transformer (DiTs) 将大部分计算花费在自注意力操作中,其成本随潜在词元数量 $n$ 呈二次方增长,$\mathcal{O}(n^2)$。对于视频生成任务,词元数量很大,因此该术语在运行时和内存中占主导地位,从而限制了我们可以生成的分辨率和持续时间。线性 $\mathcal{O}(n)$ 和低秩 $\mathcal{O}(nk)$ 自注意力代理将完整的 softmax $QK^T$ 换成更便宜的内核,但很少恢复原始的表达能力,留下了顽固的质量差距。受此启发,我们提出了 SQuad,一个次二次注意力 蒸馏 框架,它在最终的注意力集中实现了 $\mathcal{O}(n\sqrt{n})$ 的复杂度,自然地平衡了效率与表现力的权衡。我们没有从头开始训练我们自己的视频 DiT(成本过高),而是将预训练的完整 softmax Self-Attention DiT 融入到我们提出的 SQuad-Attention 中,方法是将前者分两个阶段进行提炼:流匹配监督 微调 (SFT),然后是改进的分布匹配 蒸馏 (DMD2),这进一步提高了采样效率。在 Wan~2.2 5B 文本到视频模型上,SQuAD 与 VBench 上的二次教师匹配($83.20$ v/s $83.08$),同时将每步每块注意力 FLOP 减少 $\sim$$67\times$,注意延迟减少 $\sim$$11\times$,端到端 DiT 延迟减少 2$\times$,同时还仅生成视频神经功能评估 (NFE) 为 6 美元,而不是默认的 100 美元。