论文

LoomVideo:将多模态输入统一到视频生成和编辑中

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

模型架构混合架构

摘要

开发能够解释交错多模态输入的统一视频生成和编辑模型是一个充满希望但又充满挑战的前沿领域。现有的统一框架主要依赖于大规模模型(通常为 13B 参数或更多),并通过连接序列标记合并源视频条件进行编辑。这种串联不可避免地使序列长度加倍,使自注意力机制的计算复杂性增加四倍,并引入令人望而却步的开销。为了解决这些瓶颈,我们推出了 LoomVideo,这是一种用于视频生成和编辑的高效 5B 参数统一架构。 LoomVideo 用 Multimodal 大语言模型 (MLLM) 取代标准文本编码器,并采用 Deepstack 注入机制将多层 MLLM 功能与 Diffusion Transformer (DiT) 对齐。至关重要的是,我们引入了一种用于视频编辑的零开销缩放和添加调节方法。通过缩放并直接将干净的源视频潜在值添加到噪声目标潜在值中,这种优雅的设计消除了词元串联的需要,大大降低了计算成本,同时保持了复杂、非刚性编辑的强大功能。此外,无缝集成负时间 RoPE 策略来处理多个参考图像。大量实验表明,我们的紧凑型 5B 模型在综合基准测试中实现了最先进或极具竞争力的性能,在电子商务和时尚生成场景中展现出非凡的优势。受益于零开销调节机制,与类似功能的模型相比,LoomVideo 的推理速度至少提高了 5.41 倍,为高度实用且高效的视频基础模型铺平了道路。