论文

SGF+:分离上下文写入与去噪的视频生成训练

SGF+: Decoupling Gradient Flows for Autoregressive Video Generation

模型训练上下文与知识应用与实践监督微调与指令调优上下文工程内容创作

摘要

自回归视频生成需要对当前帧进行降噪,同时将其键值表示写入作为未来预测的上下文。然而,这两个角色通常共享参数,我们发现它们的梯度表现出不同的模式和系统的负对齐,阻碍了视觉质量和时间一致性的联合优化。我们引入了自梯度强迫加(SGF+),它为上下文写入和去噪分配单独的参数,同时通过因果注意保留它们的交互。两个角色都使用原始生成目标进行联合优化,没有辅助损失,并且上下文写入通过其对未来预测的贡献进行监督。这个简单的改变提高了逐帧和逐块生成中评估基线的视觉质量和长视野一致性,而无需额外的视频训练数据或更长的训练视野。仅经过 5 秒的部署训练,SGF+ 支持长达 24 小时的连续生成,无需长视频微调。这些结果突出了特定于角色的 参数化作为高质量自回归视频生成和本地长视野外推的有效设计原则。

SGF+:分离上下文写入与去噪的视频生成训练:论文原图
图 4:SGF 和 SGF+ 的训练流程。第 1 遍执行无梯度自回归推出,并在采样去噪出口处记录分离的干净上下文潜在变量 XX 以及噪声目标潜在变量 Z⋆Z^{\star}。第 2 遍根据记录的潜在变量重建前向计算,允许未来一代损失通过可微的上下文 KV 状态来监督上下文写入。 SGF 在共享参数 θ\theta 上累积上下文写入和去噪梯度,而 SGF+ 将单独的参数 θc\theta_{c} 和 θd\theta_{d} 分配给这两个角色。