论文
DomainShuttle:自由格式开放域主题驱动的文本到视频生成
DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
摘要
开放域主题驱动的文本到视频(S2V)生成引起了学术界和工业界的极大兴趣。开放域S2V主要涉及两种场景:域内,要求尽可能保留参考主题特征;跨域,保留主题的内在特征,同时允许与主题无关的属性根据文本提示灵活变化。现有的方法主要侧重于在域内场景中最大化主题保真度,这限制了它们在跨域场景中的可编辑性和适应性,例如新颖的样式、语义组合或域属性。在本研究中,我们提出理想的S2V方法应该在不同域之间灵活穿梭,在域内和跨域场景中都实现强大的性能。为此,我们提出了 DomainShuttle,它可以实现开放域视频个性化的高保真度和生成灵活性。具体来说,我们引入了 Domain-MoT,它将视频和参考特征解耦,并引入了领域感知 AdaLN,用于参考图像的特定领域建模。然后,我们介绍了视频参考 DualRoPE 方案,该方案将参考图像标记和视频标记放置在单独的 RoPE 空间中,以实现精确的主题级空间建模,以及跨对一致性损失,旨在提取不受不相关特征影响的内在主题特征。大量实验表明,DomainShuttle 比现有方法实现了显着的性能改进,在不同的开放域应用场景中表现出高主题保真度和生成灵活性。