论文

EM-Vid:无需训练 以实体为中心的记忆,用于高效、一致的多镜头视频生成

EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation

摘要

多镜头视频生成需要保持各个镜头中重复实体的外观一致,同时保持忠实于特定于镜头的文本提示。最近的自回归方法重用以前生成的帧作为内存。然而,全帧存储将持久实体信息与瞬态场景上下文纠缠在一起,导致不相关的信息泄漏和高昂的计算成本。我们提出了一种以实体为中心的记忆,其形式是实体索引的潜在补丁库。我们引入了与预训练模型兼容的稀疏词元条件,将自我注意力限制在与实体相关的词元上,并降低了计算成本。为了支持这一点,我们引入了结构化的多镜头脚本格式。我们还提出了一种预算内存更新策略,以保持紧凑、不断发展的内存。最后,我们为实体表示配备了噪声注入机制,可以实现细粒度的外观控制,防止无关信息的泄漏。我们的方法提高了及时的依从性和效率,同时保持了受试者的一致性。