论文
MMControl:用于联合音频-视频生成的统一多模态控制
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
摘要
Diffusion Transformer (DiTs) 的最新进展实现了高质量的联合音频-视频生成,在单个模型中生成具有同步音频的视频。然而,现有的可控生成框架通常仅限于仅视频控制。这限制了综合可控性,并且常常导致跨模式对齐不理想。为了弥补这一差距,我们提出了 MMControl,它使用户能够在联合音频-视频生成中执行多模式控制。 MMControl引入了双流条件注入机制。它将视觉和声学控制信号(包括参考图像、参考音频、深度图和姿势序列)整合到联合生成过程中。这些条件通过旁路分支注入到联合音视频扩散 Transformer 中,使模型能够在结构约束下同时生成身份一致的视频和音色一致的音频。此外,我们引入了特定于模态的指导缩放,它允许用户在推理时独立且动态地调整每个视觉和听觉条件的影响强度。大量实验表明,MMControl 在联合音视频生成中实现了对角色身份、音色、身体姿势和场景布局的细粒度、可组合控制。