论文
SwiftAudio:数据高效的仅文本描述 蒸馏,用于基于文本到音频扩散的一步生成
SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation
摘要
基于扩散的文本转音频 (TTA) 模型实现了令人印象深刻的合成质量,但由于迭代多步去噪而导致推理延迟较高。现有的一步式方法缓解了这一问题,但在 蒸馏 期间仍然依赖于配对文本-音频数据。为了解决这些限制,我们提出了 SwiftAudio,这是一种一步式 TTA 框架,它仅使用文本字幕从预训练的扩散教师那里执行无音频 蒸馏。具体来说,我们将变分分数 蒸馏 (VSD) 应用于音频域,并引入时间平滑正则化目标以鼓励连贯的潜在音频表示。这种设计使学生模型能够继承教师的生成先验,无需配对音频监督,并且只需大约 45K 字幕即可进行有效训练。 AudioCaps 和 Clotho 上的实验表明,SwiftAudio 在严格的一步法中实现了最先进的性能,并大大缩小了与多步扩散系统的差距。项目页面:https://swiftaudio.org/