论文

通过能量评分和辅助上下文表示进行一步采样的快速文本到音频生成 蒸馏

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

模型推理推理加速

摘要

具有扩散头的自回归 (AR) 模型最近实现了强大的文本到音频性能,但其迭代解码和多步采样过程引入了高延迟问题。为了解决这一瓶颈,我们提出了一种一步采样框架,将能量距离训练目标与表示级 蒸馏 相结合。能量评分头一步即可将高斯噪声直接映射到音频潜伏,从而无需昂贵的递归扩散采样过程,而来自掩码自回归 (MAR) 文本到音频模型的 蒸馏 保留了扩散训练期间学到的强条件作用。在 AudioCaps 基准测试中,我们的方法在客观和主观指标上始终优于先前的一步基线,例如 ConsistencyTTA、SoundCTM、AudioLCM 和 AudioTurbo,同时通过多步采样大幅缩小了与 AR 扩散系统的质量差距。与最先进的 AR 扩散系统 IMPACT 相比,我们的方法可将批量推理速度提高8.5倍,并且具有极具竞争力的音频质量。这些结果表明,将能量距离训练与表征级 蒸馏 相结合,为快速、高质量的文本到音频合成提供了有效的方法。