论文

LeVo 2:通过分层表示建模和渐进后训练生成稳定而悠扬的歌曲

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

应用与实践内容创作

摘要

完整长度的歌曲生成必须保持连贯性和音乐性,呈现详细的人声和伴奏声学效果,并遵循歌词和提示。现有的基于语言模型的系统面临着结构性权衡:混合词元建模保留了声乐乐器协调,但模糊了轨道特定的细节,而双轨预测改善了声学效果,但需要更长的序列并削弱了全局规划。我们推出了 LeVo 2,这是一种用于可控全长歌曲生成的混合 LLM-Diffusion 框架。 LeVo 2 将这种权衡表述为分层建模:LeLM 首先预测混合标记以进行语义规划,然后并行预测声乐和伴奏标记以进行特定于曲目的细化,同时基于扩散的音乐编解码器重建全长波形。这个扩展版本的一个核心贡献是一个以美学为导向的对齐训练计划。在 预训练 期间,自动音乐美学评估框架将音乐性等级条件分配给大规模数据,在偏好对齐之前提供音乐性先验。 渐进后训练采用SFT、大规模离线DPO和闭环半在线DPO分别提高生成质量、可控性和音乐性。然后,模块化扩展训练 Track-Specific LM 进行声学细化,同时保留对齐的语义规划器。该时间表将音乐性学习、可控性对齐和声学细化分开,减轻优化冲突和静态离线偏好对的限制。专家听力测试和客观评估表明,LeVo 2 在六个主观维度上均优于开源基线,并在多个听力指标上接近领先的商业系统。消融验证了训练策略、美学指导、缩放和分层架构的效果。