论文
将歌词到旋律生成的语言模型与基于规则的音乐约束相结合
Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints
摘要
大语言模型 (LLM) 在歌词到旋律的生成方面表现出了良好的前景,但使用监督式 微调 (SFT) 训练的模型通常会产生音乐上不可信的旋律,并存在节奏不佳和音域不合适等问题,我们将这种现象称为“约束违规”。为了解决这个问题,我们提出了一种新颖的对齐框架,无需人工注释即可灌输音乐知识。我们定义基于规则的音乐约束,以从 SFT 模型的输出自动生成偏好数据集。然后,该模型通过顺序过程进行对齐,首先对配对偏好数据使用直接偏好优化 (DPO),然后对未配对的负样本使用卡尼曼-特沃斯基优化 (KTO)。实验结果表明,我们的对齐模型大大减少了规则违规,并且在客观和主观评估方面都优于强大的基线,生成的旋律具有显着改善的音乐性和连贯性。带有音频比较的交互式演示可在 https://arain233.github.io/AligningMelody-demo 上找到。