论文

Woosh:声音效果基础模型

Woosh: A Sound Effects Foundation Model

应用与实践内容创作

摘要

音频研究社区依赖开放生成模型作为构建新颖方法和建立基线的基础工具。在本报告中,我们介绍了索尼 AI 公开发布的音效基础模型 Woosh,详细介绍了其架构、训练过程以及对其他流行开放模型的评估。针对声音效果进行了优化,我们提供(1)高质量音频编码器/解码器模型和(2)用于调节的文本音频对齐模型,以及(3)文本到音频和(4)视频到音频生成模型。该版本还包含经过提炼的文本到音频和视频到音频模型,可实现低资源操作和快速推理。我们对公共和私人数据的评估表明,与 StableAudio-Open 和 TangoFlux 等现有开放替代方案相比,每个模块的性能具有竞争力或更好。推理代码和模型权重可在 https://github.com/SonyResearch/Woosh 上获取。演示示例可在 https://sonyresearch.github.io/Woosh/ 找到。