论文

MusicLayout:用于可控文本到音乐生成的显式结构规划

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

模型训练监督微调与指令调优

摘要

文本到音乐的生成已经迅速发展,但当前的系统仍然主要依赖于全局文本提示,使得生成的音乐的结构组织是隐式的,并且在音频生成之前难以检查、控制或修改。为了解决这个问题,我们引入了 MusicLayout,这是一种用于控制文本到音乐生成中的音乐结构的显式中间表示。 MusicLayout 将音乐作品描述为部分、纹理、重复、变化和乐器级别排列的时间对齐布局,充当文本意图和生成的音乐之间的可解释规划层。我们将 MusicLayout 集成到基于统一自回归公式构建的文本到音乐框架中,其中模型首先生成 MusicLayout 表示,然后在单个序列中预测以该表示为条件的音频标记。可以在音频生成之前检查和修改生成的 MusicLayout,从而提供布局级结构控制的机制。我们通过布局条件生成、布局操作实验和匹配数据消融来评估 MusicLayout,提供证据表明显式布局规划可以改善远程结构组织并支持布局级别控制。我们已在 GitHub 上以开源方式发布了该实现:https://github.com/XaryLee/MusicLayout。