论文

自对齐强迫:具有可微噪声历史的流视频扩散

Self-Aligned Forcing: Streaming Video Diffusion with Differentiable Noisy History

模型训练预训练

摘要

自回归视频扩散可以生成交互式流媒体,但会在长时间部署过程中遭受错误累积的影响。自我rollout训练减少了暴露偏差,但有限的rollout导致长程漂移无法解决。我们观察到历史键值(K/V)表示的噪声水平会牺牲视觉质量和运动,并且通过历史恢复梯度使因果训练与双向训练更加紧密地结合起来。受这些观察的启发,我们引入了自对齐强迫(SAF),这是一种训练方案,可将每个块的历史与正在去噪的块的噪声水平对齐。具体来说,历史是同一去噪阶段的前一个块产生的 K/V,因此一个阶段的所有块都可以在因果掩码下通过单次前向传递进行去噪。这使得噪声历史保持可微分,从而允许未来的损失优化其编码方式。因此,SAF 避免了单独的无梯度rollout和每块时间步长零重新缓存,训练速度比以前使用较低内存的方法快 1.8 倍。在推理时,SAF 在现有方法中实现了最高的单 GPU 吞吐量,并为多 GPU 管道的每个阶段保留一个历史库,在 4 个 GPU 上达到 49.1 FPS。实验表明,具有出色的长视距生成能力,并且在视觉质量和运动之间取得了更好的平衡。项目页面:https://anonymous.4open.science/w/self-aligned-forcing/.