论文
用于生成长格式多镜头视频的多网格 后训练
Multi-Grid Post-Training for Long-Form Multi-Shot Video Generation
摘要
生成长格式多镜头视频需要连贯的镜头内运动和跨镜头的视觉一致的叙述。现有的视频生成器倾向于连续运动,并且当整个叙述沿着一个时间轴排列时很难呈现完整的镜头集。我们提出了 MovieGrid,这是一种多网格 后训练 范例,它将长视频分解为较短的、按时间顺序排列的块,并将它们排列在空间网格上以进行联合建模。这种设计减少了每个时间轴处理的镜头数量,同时实现了跨块的全局信息交换。我们使用源视频收集、分层分割、网格视频构建和角色感知故事注释,从 1,000 个长视频构建了多网格长视频 (MGLV) 数据集,生成与故事提示配对的 54K 网格视频。我们的无噪声随机网格训练保留了块的随机子集作为干净的视觉上下文,用于对剩余块进行去噪。网格嵌入对网格结构进行编码,字符感知的故事提示链接重复出现的实体,而网格边界损失则稳定了布局。在相同的 词元预算 下,MovieGrid 在 1,616 帧视频中生成的镜头比 Temporal Packing 多 6.05 倍。在涵盖五个现实世界类别的基准测试中,它实现了最先进的镜头内一致性(HoloCine 为 0.9131 对比 0.8086)和镜头间一致性(StoryMem 为 0.5914 对比 0.5384)。 MovieGrid 可以通过单代或多代以最小的妥协进一步扩展视频长度。