论文

AudioX-Turbo:高效生成任何内容的统一框架

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

摘要

基于灵活的多模态控制信号的音频和音乐生成是一个广泛应用的主题,具有以下关键挑战:1)统一的多模态建模框架,2)大规模、高质量的训练数据,以及3)多步扩散采样的推理成本过高。因此,我们提出了 AudioX-Turbo,这是一个用于生成任何内容到音频的统一且高效的框架,在这项工作中集成了各种多模态条件(即文本、视频和音频信号)。 AudioX-Turbo 遵循师生范式。教师 AudioX-Base 基于多模态扩散 Transformer 构建,具有多模态自适应融合模块,该模块可对齐不同的多模态输入以进行高保真合成,然后通过适应流匹配的分布匹配 蒸馏 提炼为少步学生 AudioX-Turbo,并辅以基于扩散的鉴别器以实现高质量少步生成。为了支持 AudioX-Turbo 的训练,我们构建了一个大规模、高质量的数据集 IF-caps-Pro,其中包含通过两阶段数据收集和注释管道整理的约 920 万个样本。我们在广泛的任务中对 AudioX-Turbo 进行了基准测试,发现我们的模型实现了卓越的性能,特别是在文本到音频和文本到音乐的生成方面,同时仅需要 4 个采样步骤,并且所需的功能评估 (NFE) 比多步骤基线少约 25 倍。这些结果表明,我们的方法能够在灵活的多模态控制下生成音频,显示出高效且强大的指令跟踪能力。代码和数据集可在 https://zeyuet.github.io/AudioX-Turbo/ 获取。