论文

LogiShot:逻辑连贯的交叉镜头视频生成

LogiShot: Logically Coherent Cross-Shot Video Generation

上下文与知识上下文工程

摘要

生成逻辑上相互连接的交叉镜头视频对于内容创作至关重要。目前,大多数交叉镜头视频生成工作流程(例如短剧制作)仍然依赖于孤立的文本脚本或明确的参考图像来指定生成的内容。因此,当用户指令不明确或不明确时,生成的剪辑可能在视觉上看起来合理,但无法与整体叙述保持一致,从而导致内容脱节。我们认为,在视频生成中实现跨镜头逻辑连贯性需要在镜头之间建立逻辑连接并保持视觉一致性。为此,我们提出了 LogiShot,它通过两个互补路径合并信息:1)LogiShot 联合编码上下文视频和其他条件信号,产生密集的多模态线索,为交叉镜头生成提供视觉语义证据; 2)模型在整个生成过程中保持上下文视频的视觉记忆,以保持镜头之间的视觉一致性。此外,我们构建了一个包含 11 万个样本的数据集和一个用于评估跨镜头逻辑一致性的专用基准。实验表明,LogiShot 在多个镜头的逻辑一致性方面始终优于现有基线。模型和数据将公开。