论文
SGF+:分离上下文写入与去噪的视频生成训练
SGF+: Decoupling Gradient Flows for Autoregressive Video Generation
摘要
自回归视频生成需要对当前帧进行降噪,同时将其键值表示写入作为未来预测的上下文。然而,这两个角色通常共享参数,我们发现它们的梯度表现出不同的模式和系统的负对齐,阻碍了视觉质量和时间一致性的联合优化。我们引入了自梯度强迫加(SGF+),它为上下文写入和去噪分配单独的参数,同时通过因果注意保留它们的交互。两个角色都使用原始生成目标进行联合优化,没有辅助损失,并且上下文写入通过其对未来预测的贡献进行监督。这个简单的改变提高了逐帧和逐块生成中评估基线的视觉质量和长视野一致性,而无需额外的视频训练数据或更长的训练视野。仅经过 5 秒的部署训练,SGF+ 支持长达 24 小时的连续生成,无需长视频微调。这些结果突出了特定于角色的 参数化作为高质量自回归视频生成和本地长视野外推的有效设计原则。
