论文
自梯度强制:原生长视频外推
Self Gradient Forcing: Native Long Video Extrapolation
摘要
最近的自回归视频传播方法越来越多地建立在“自我强制”的基础上,学生接受的训练是其自身生成轨迹的历史,而不是 真值 视频上下文。这减少了曝光偏差,但历史键值缓存仍由未来帧仅用作冻结转出状态。因此,未来的损失无法监督如何将早期生成的潜在变量写入更有用的键和值,以供以后的视频潜在生成。我们称之为历史背景梯度差距。我们提出自梯度强迫(SGF),这是一种两遍训练策略,可以恢复丢失的监督信号,而无需通过完整的串行生成轨迹进行反向传播。第 1 遍执行无梯度自回归生成轨迹匹配推理,并在采样去噪退出步骤中记录自生成的上下文和馈送到模型的噪声潜伏。第 2 遍对记录的退出步骤执行并行上下文梯度重建。生成的上下文用作停止梯度干净潜在输入,而模型重新计算上下文 KV 表示和未来到上下文的因果注意力。因此,SGF 在本机自回归训练目标中提供了缺失的记忆写入监督,利用未来视频潜伏的损失来训练模型,将上下文编码为更有效的因果记忆。在不同初始化下的广泛长视界逐帧和逐块实验中,SGF 实现了比 Self Forcing 更强的原生长视频外推,特别是在主体身份、背景/布局一致性和时间稳定性方面。值得注意的是,仅使用 5 秒的训练窗口,SGF 就可以推断出持续几分钟的视频。将发布代码和模型以推进自回归视频生成的研究。