论文

LongTake:学习在长视野视频生成中维持动态

LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation

模型训练监督微调与指令调优

摘要

世界模型、游戏模拟器和长镜头视频创建需要连贯的场景演变和长时间的持续动态。自回归 (AR) 视频扩散为长视野生成提供了一个自然的框架,但扩展的rollout通常会变得接近静态或失去视觉质量。我们假设这些失败反映了短视频监督对于持续场景动态在较长时间内如何发展提供的指导有限。这促使我们提出LongTake,这是一个两阶段的训练管道,围绕长视野教师强制 (TF),在精选的真实长视频上构建。 Long-Horizon TF 训练 AR 模型来预测以长真实视频前缀为条件的后续帧,从而将直接监督扩展到短训练范围之外。这种监督旨在帮助模型在长视野生成过程中维持动态并保持视觉质量。我们的主要发现是,该训练阶段加强了学生自行rollout下的分布匹配蒸馏(DMD)的直接初始化,而无需标准管道中使用的中间几步蒸馏阶段。在相同的 5 秒 DMD 训练设置下,我们的初始化比 30 秒rollout的短视场 TF 初始化在相当的美学质量下产生了更高的动态程度,并且在两项测量中都超过了评估的基线。混合 DMD 进一步重用该教师,将监督扩展到自rollout的后续帧,同时保留对初始窗口的双向联合监督。在长视界自我rollout中,LongTake在动态度和美学质量方面处于Pareto前沿,而Hybrid DMD在30秒和60秒的评估方法中获得了最高的动态度。