论文
MuSS:用于多镜头主题视频生成的大规模数据集和电影叙事基准
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
摘要
虽然视频基础模型擅长单镜头生成,但现实世界的电影故事讲述本质上依赖于复杂的多镜头排序。进一步的进展受到缺乏解决三个核心挑战的数据集的限制:真实的叙事逻辑、时空文本视频对齐冲突以及主题到视频(S2V)生成中普遍存在的“复制粘贴”困境。为了弥补这一差距,我们引入了 MuSS,这是一个专为多镜头视频和 S2V 生成而定制的大规模双轨数据集。 MuSS 源自 3,000 多部电影,明确支持复杂的蒙太奇过渡和以主题为中心的叙事。为了构建这个数据集,我们开创了一种渐进式字幕管道,通过在强制全局叙事连贯性之前确保局部镜头级别的准确性来消除上下文冲突。至关重要的是,我们实现了跨镜头匹配机制,从根本上消除 S2V 复制粘贴捷径。除了数据集之外,我们还提出了电影叙事基准,其特点是视觉逻辑驱动的范例和新颖的反复制粘贴方差 (ACP-Var) 指标,以严格评估连续的故事讲述和 3D 结构一致性。大量的实验表明,虽然当前的基线在连续的叙事逻辑上挣扎或退化为琐碎的 2D 贴纸生成器,但我们的 MuSS 增强模型实现了最先进的叙事有效性和交叉镜头身份保留。