论文
OmniVAE:具有跨模态对齐联合生成功能的音频-视频 VAE
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
摘要
最近的生成模型正在超越无声视频或独立音频合成,转向同步音频和视频的联合生成。尽管取得了这些进展,但由于其根本的结构差异,联合生成具有细粒度跨模式对应的音频和视频仍然具有挑战性。大多数现有方法使用单独训练的音频和视频 VAE。因此,两个潜在空间缺乏跨模态对齐,使得下游生成模型从头开始学习跨模态同步。我们提出了 OmniVAE,这是一种联合训练的音频-视频 VAE,可以学习音频和视频潜在表示之间的细粒度语义对齐。除了重建之外,OmniVAE 还使用分段级音频-视频对比目标来捕获时间语义对应并对齐两个潜在空间。同时,它将预训练的特定于模态的语义编码器中的特征提取到每个模态中,从而提高了两个潜在空间的下游可学习性。大量的实验表明,这两个目标始终如一地提高了潜在空间的可学习性,在下游文本到音频视频的生成中转化为更高的生成质量和更准确的跨模式同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。1