论文
MoRoute:用于上下文多模态视频生成的动态路由
MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
摘要
多模态视频生成旨在生成和编辑以单个模型中文本、图像和视频的任意组合为条件的视频,从而允许不同的任务共享互补数据和生成先验。统一这些任务需要对不同条件的多模式理解,这通常由预训练的视觉语言模型(VLM)提供。一个关键的挑战是如何将 VLM 的分层多模态表示与预训练的视频扩散 Transformer (DiT) 连接起来。现有方法要么仅从最终或几个手动选择的 VLM 层注入特征,要么联合训练架构匹配的理解和生成流,从而难以重用异构预训练主干。我们介绍了 MoRoute,一个统一的多模态视频生成框架,它制定了一个冻结的 VLM 和一个预训练的视频 DiT,它们具有不同的架构,作为通过动态层路由连接的异构专家。对于每个输入,轻量级块级路由器使每个 DiT 块能够选择与其生成阶段最相关的 VLM 层,从而学习多模态理解和视频合成之间的自适应对应关系。 MoRoute 通过统一的上下文调节,进一步将参考图像和源视频直接合并到 DiT 词元序列中,从而在不同的生成和编辑任务中保留细粒度的视觉细节。在IntelligentVBench、OpenVE-Bench和RefVIE-Bench上的实验表明,MoRoute在每个基准测试中始终超越最佳竞争方法,在1-5等级上分别将平均分数提高了0.15、0.18和0.34。