论文
万松v1.0技术报告
WanSong v1.0 Technical Report
摘要
音乐生成基础模型最近引起了业界的广泛关注。然而,在支持可控性的同时实现高效生成和高保真长格式音频仍然具有挑战性。为了满足这些需求,我们提出了 \textbf{WanSong},这是一种简单但功能强大的长格式商业级歌曲生成方法。与自回归(AR)和级联多级管道(例如,AR 随后扩散)不同,\textbf{WanSong} 是一种纯粹的基于扩散的模型,可直接生成长达 5 分钟的高保真多语言歌曲,并在一次运行中输出双干(人声和背景音乐)。此外,我们的扩散框架可以通过步骤 蒸馏 实现更快的推理,并为 微调 和定制提供有效的途径以支持下游编辑任务。