论文

UNITE-AUDIO:用于文本到音频生成的连续标记化和潜在流匹配的联合学习

UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

模型训练预训练

摘要

文本到音频 (TTA) 生成旨在合成忠实反映自然语言描述的真实音频。大多数 TTA 系统采用两阶段潜在范式:音频分词器针对重建进行优化,然后冻结,然后在生成的潜在空间中训练生成模型。然而,面向重建的表示对于生成、激励联合表示和生成学习来说可能不是最佳的。为此,我们引入了 Unite-Audio,据我们所知,它是第一个联合学习 TTA 的连续音频表示和潜在流匹配的。通过将重建与自监督生成预测相结合,Unite-Audio 允许生成目标直接塑造潜在空间,而不是将其视为固定的中间表示。我们进一步采用 Flow-GRPO 后训练来改进文本条件生成。实验表明,紧凑的潜在流模型具有具有竞争力的 TTA 性能,而消融研究则证实了联合学习音频表示和生成模型的好处。音频样本可在此 https URL 获取。