论文

Stable Audio 3:支持可变长度生成与局部编辑的扩散音频模型

Stable Audio 3

应用与实践内容创作

摘要

Stable Audio 3 是一系列快速潜在扩散模型(小、中、大),用于可变长度音频生成和编辑。由于我们的模型可以生成几分钟的音频,因此可变长度生成是避免生成短声音的全长生成成本的关键。我们还支持局部补全,实现有针对性的音频编辑和短录音的延续。我们的潜在扩散模型在新颖的语义声学自动编码器之上运行,该编码器将音频投影到紧凑的潜在空间中,从而实现基于扩散的高效生成,同时保留音频保真度并鼓励潜在的语义结构。最后,我们运行对抗性 后训练 来加速推理并提高生成质量,减少推理步骤数量,同时提高保真度和提示遵循。 Stable Audio 3 模型经过许可和知识共享数据的训练,可在 H200 GPU 上不到 2 秒、在 MacBook Pro M4 上不到几秒内生成音乐和声音。我们发布了可以在消费级硬件上运行的小型和中型权重,以及它们的训练和推理管道。