论文
Ms. Forcing:通过多尺度修补和注意力机制实现高效流媒体视频生成
Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention
摘要
流视频扩散模型在交互式和动态世界模拟方面取得了实质性进展,但传统下一帧生成的嵌套自回归和去噪循环阻碍了实时部署。最近的滚动窗口方法在不同噪声水平的多个连续帧上进行管道降噪,从而提高吞吐量和长范围稳定性。然而,它们以相同的精细空间粒度标记每个状态,从而在联合去噪窗口中留下大量与噪声相关的冗余。我们提出了 Ms.Forcing,一种高效的流媒体视频生成范例,可以使空间粒度适应每个状态的噪声水平。其多尺度补丁化 (MSP) 将较粗的补丁分配给噪声较大的状态,从而将活动窗口标记计数减少 45%,而多尺度自注意力 (MSSA) 将可见非接收器键和值的密度与每个查询尺度相匹配,以进一步降低注意力成本。由于两个计划都是由窗口位置固定的,因此 Ms.Forcing 保留了静态的、硬件友好的计算图。我们进一步引入了同质噪声级 DMD (H-DMD),它从共享相同源噪声级的干净预测中组装每个假视频,从而减少 DMD 训练序列和推理时生成轨迹之间的不匹配。多尺度设计有助于抵消通过重叠窗口反向传播的额外训练成本。我们通过定量和定性实验表明,Ms.Forcing 在单个 H200 GPU 上达到了 22.84 FPS,比 Rolling Forcing 快 39.6%,同时在短视频和长视频生成设置中显着提高了 VBench 分数。