论文
通过潜在空间探针进行基于扩散的音乐生成的音高级转向
Pitch-class Steering for Diffusion-based Music Generation via Latent-space Probes
摘要
最近关于可控音乐生成的工作主要集中在自回归模型上,而基于扩散的系统的探索相对较少。我们提出了一种轻量级方法来控制由 Stable Audio Open 生成的音频的音高内容,这是一种用于音乐合成的潜在扩散模型。包含大约 125k 参数的小型卷积探针经过训练,可以使用配对的音频和 MIDI 数据从模型的变分自动编码器潜在空间解码帧级音调级激活。在推理时,冻结的探针充当可微的损失函数:其相对于去噪潜伏的梯度用于将生成推向用户指定的音级序列,无需对基础模型进行重新训练或架构修改。在涵盖 9 个文本提示和 3 个目标旋律的 27 项评估试验中,探针引导生成将旋律连贯性比无引导基线提高了 2.4 倍(p < 1e-5,Wilcoxon 符号秩检验),证明在基于扩散的音乐潜在空间中,具有音乐意义的结构是可恢复和可操纵的。