论文

SketchSong:具有草图规划和细粒度多轨建模的分层歌曲生成

SketchSong: Hierarchical Song Generation with Sketch Planning and Fine-Grained Multi-Track Modeling

应用与实践内容创作

摘要

最近的歌曲生成系统可以合成逼真的音频,但生成完整的歌曲仍然具有挑战性,原因有两个。首先,现有方法中明确的歌曲级编曲规划仍然受到限制,因此模型通常需要在生成底层音频细节的同时组织整体编曲开发。这通常会导致安排不连贯,例如薄弱的部分过渡和有限的动态进展。其次,不同音乐部分的粗略建模模糊了它们不同的角色和相互作用,限制了生成歌曲的编排丰富性。在本文中,我们提出了 SketchSong,一个分层的歌曲生成框架,它通过歌曲级草图规划和细粒度的多轨建模来解决这些问题。沿着时间维度,SketchSong 首先预测从压缩音频表示派生的高级草图标记的紧凑序列,然后生成以这些草图为条件的音频标记。这种从粗到细的过程在详细的音频生成之前为模型提供了明确的安排计划。沿着轨道维度,SketchSong 明确建模了四个轨道,即人声、贝斯、鼓和其他乐器。这使得模型能够更精确地捕捉不同音乐部分的角色和相互作用。歌曲生成基准实验表明,SketchSong 在客观指标和人类听力测试方面始终优于我们的基准。尽管没有使用额外的 后训练 进行偏好优化(例如歌词和文本提示对齐),SketchSong 仍取得了与强大的、经过训练的开源系统竞争的结果,证明了我们整体设计的有效性。