论文
通过具有表示连续性的局部优化加速自回归视频生成模型的训练
Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity
摘要
自回归模型在图像生成方面表现出了卓越的性能和效率,但仍然受到视频生成方面高计算成本和较长训练时间的限制。在本研究中,我们通过实证分析探索加速自回归视频生成模型训练的方法。我们的结果表明,虽然对较少视频帧的训练显着减少了训练时间,但它也加剧了错误累积并在生成的视频中引入了不一致。为了解决这些问题,我们提出了一种局部优化(Local Opt.)方法,该方法在局部窗口内优化词元,同时利用上下文信息来减少错误传播。受 Lipschitz 连续性的启发,我们提出了表示连续性(ReCo)策略来提高生成视频的一致性。 ReCo 利用连续性损失来约束表示变化,提高模型鲁棒性并减少错误累积。对类和文本到视频数据集的大量实验表明,我们的方法在不牺牲质量的情况下实现了优于基线的性能,同时将训练成本减半。