论文
Unison:协调运动、语音和声音,生成以人为本的音频视频
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
摘要
运动、语音和声音效果是以人为中心的视频的基本元素,但它们的异构时间特征使得联合生成极具挑战性。现有的音频-视频生成模型通常无法在这些模式之间保持一致,从而导致运动、语音和环境声音之间出现明显的不匹配。我们提出了 Unison,一个统一的框架,明确促进了动作、言语和声音模式的连贯性。在音频流中,Unison 采用语义引导的协调策略,将语音和音效组件的生成解耦。利用双向音频交叉注意和语义条件门控进行语义驱动的自适应重组,该方法有效地减轻了语音优势并增强了声音清晰度。对于音频运动同步,我们提出了一种双向跨模态强制策略,其中更干净的模态通过解耦的降噪时间表引导噪声更高的模态,并通过渐进稳定策略得到加强。大量实验表明,Unison 在音频感知质量和跨模态同步方面均实现了最先进的性能,凸显了显式多模态协调在以人为中心的视频生成中的重要性。