论文
DriftAudio:一步式文本转音频生成器的分布式训练后的边缘漂移
DriftAudio: Marginal Drifting for Distributional Post-Training of One-Step Text-to-Audio Generators
摘要
最近的一步文本到音频(TTA)模型大大降低了推理成本,但其生成的分布仍然可以通过后期训练来改进。我们提出了 DriftAudio,一种分布式训练后方法,可将 Drifting 适应预训练的单步 TTA 生成器。在自由格式文本条件下,按条件应用漂移具有挑战性,其中通常只有一个或几个真实样本可用于特定条件。相反,DriftAudio 在边缘音频分布上执行漂移,同时保留文本条件生成。使用重采样的真实样本、滚动的生成样本库和当前批次的生成样本在冻结的音频特征空间中估计漂移场。由此产生的漂移场提供了一个独立的训练目标,用于仅更新生成器,保留原始的一步推理过程。在 AudioCaps 上,从 MeanAudio 开始,DriftAudio 分别将 FAD 和 FD 降低了 33.9% 和 17.6%,同时还改进了 KL 和 CLAP。从FdAudio开始,进一步减少了FAD、FD和KL,并在IS和CLAP上进行了权衡。这些结果证明了边际分布后训练对于一步 TTA 生成的有效性。