论文
Omni-Customizer:用于联合音频-视频生成的端到端多模式定制
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
摘要
强大的基础模型的出现从根本上改变了音频和视频联合生成的格局。尽管取得了这些进步,但实现有凝聚力的多模式定制以同时保留多个交互主体的视觉身份和声音音色仍然很大程度上尚未得到充分探索。为了弥补这一差距,我们推出了 Omni-Customizer,这是一个端到端框架,旨在实现多模式身份信息的精确绑定和无缝融合。具体来说,我们引入了全上下文融合(OCF)模块,该模块可以通过密集的多模式身份提示有效地丰富基本文本提示,以及专门设计用于防止严重的“语音泄漏”问题的屏蔽 TTS 交叉注意(MTP-CA)机制。在此架构中,我们提出语义锚定多模态 RoPE (SA-MRoPE) 将视觉和音频参考标记以及 TTS 嵌入锚定到其相应的语义描述,从而实现结构化多模态融合和强大的身份绑定。此外,我们设计了一种全面的训练策略,其中结合了交错的音频-视频调度,以在不降低基础先验的情况下快速使音频分支适应多语言场景,以及渐进的配对到跨配对课程,以促进高级和强大的身份特征的学习。大量实验表明,Omni-Customizer 在双模式定制生成方面实现了最先进的性能,在视觉识别相似性、音色一致性、精确的音视频同步和整体音视频保真度方面表现出色。