论文
通过混合注意力和解耦 蒸馏 生成长视野流视频
Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
摘要
流视频生成 (SVG) 将预训练的双向视频扩散模型提炼为配备滑动窗口注意 (SWA) 的自回归模型。然而,SWA 在长时间视频生成过程中不可避免地会丢失遥远的历史记录,其计算开销仍然是实时部署的关键挑战。在这项工作中,我们提出了混合强迫,它通过混合注意力设计联合优化时间信息保留和计算效率。首先,我们引入轻量级线性时间注意力来保留滑动窗口之外的长程依赖性。特别是,我们维护一个紧凑的键值状态,以增量地吸收被逐出的词元,以可忽略的内存和计算开销保留时间上下文。其次,我们将块稀疏注意力纳入局部滑动窗口,以减少短程建模中的冗余计算,将计算能力重新分配给更关键的依赖项。最后,我们引入了一种针对混合注意力设计的解耦 蒸馏 策略。在密集注意力下执行几步初始 蒸馏,然后激活我们提出的线性时间和块稀疏注意力的 蒸馏 进行流建模,确保稳定的优化。对短视频和长视频生成基准的大量实验表明,混合强制始终能够实现最先进的性能。值得注意的是,我们的模型在单个 NVIDIA H100 GPU 上以 29.5 FPS 的速度实现实时、无限制的 832x480 视频生成,无需量化或模型压缩。源代码和训练模型可在 https://github.com/leeruibin/hybrid-forcing 获取。