论文

WavFlow:波形空间中的音频生成

WavFlow: Audio Generation in Waveform Space

应用与实践内容创作

摘要

现代音频生成主要依赖于潜在空间压缩,这会带来额外的复杂性和潜在的信息丢失。在这项工作中,我们用 WavFlow 挑战了这种范式,WavFlow 是一个直接在原始波形空间中生成高保真音频而无需中间表示的框架。为了克服高维和低能量信号建模的固有困难,我们通过波形修补将音频重塑为 2D 词元网格,并引入幅度提升来对齐信号尺度,从而通过流匹配中的直接 x 预测实现稳定优化。为了捕获复杂的语义对齐和时间同步,我们利用自动化数据管道来管理 500 万个高质量的视频-文本-音频三元组,使模型能够从头开始学习细粒度的声学模式。实验结果表明,WavFlow 在视频转音频基准 VGGSound(FD_PaSST:59.98,IS_PANNs:17.40,DeSync:0.44)和文本转音频基准 AudioCaps(FD_PANNs:10.63,IS_PANNs:12.62)上实现了具有竞争力的性能,匹配或超过了已建立的基于潜在的方法的性能。我们的工作表明,中间压缩并不是高质量合成的先决条件,为多模态音频生成提供了更简单、更可扩展的替代方案。