论文

原生视听对齐生成

Native Audio-Visual Alignment for Generation

应用与实践内容创作

摘要

联合音视频生成旨在合成时间同步且语义连贯的视声内容。然而,现有的开源方法主要依赖于后对齐的双塔设计或完全统一的三模态设计,将文本上下文、音频和视频混合在一个共享空间中。前者削弱了细粒度的音视频协同进化,而后者则将语义调节与低级同步结合起来。为了解决这些限制,我们提出了 NAVA,一种用于联合音频-视频生成的本机音频-视觉对齐框架。 NAVA 建立在上下文条件的原生视听对齐基础上:它首先在专用交互空间中建立音频-视频对应,然后使用外部上下文来调节联合去噪过程。具体来说,NAVA 使用 Align-then-Fuse MMDiT 架构进行实例化,该架构从模态感知的音频-视频对齐过渡到模态共享的联合去噪。此外,我们引入了语境音色调节,将参考音色提示与相应的语音跨度相关联,以实现可控的语音音色。 Verse-Bench 和 Seed-TTS 上的实验以及用户研究表明,NAVA 仅使用 6.3B 参数即可实现卓越的视频质量、精确的视听同步、有竞争力的音频质量以及更强的参考音色可控性。