论文

推动全歌曲生成的前沿:分层自回归规划与流程匹配渲染的结合

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

应用与实践内容创作

摘要

在本报告中,我们提出了一个统一的歌曲生成框架,能够根据歌词、文本描述和音乐属性生成高质量的完整音乐。所提出的框架支持三个任务:歌词到歌曲生成,根据文本描述、歌词和音乐属性生成完整的歌曲;器乐生成,创造没有人声的音乐;翻唱歌曲生成,以不同的风格重新诠释现有歌曲,同时保留其旋律内容。在架构上,我们的系统由四个主要组件组成:语义感知分词器、hybird-LM、FullDiT 和两级旋律模块。标记器将音频编码为 8 码本 RVQ 标记,以实现高效的离散音乐表示。基于这些标记,hybird-LM 执行分层自回归音频标记建模以生成完整歌曲。为了提高音频保真度,FullDiT 在以编解码器标记、歌词和文本描述为条件的连续 VAE 潜在空间中执行全歌曲流匹配。对于翻唱歌曲生成,旋律模块从参考音频中提取并离散化旋律提示,以指导生成,同时保留原始旋律内容。最后,我们研究了 DPO、GRPO 和 OPD 作为混合LM 的基于奖励的 后训练 策略,并将基于流的 GRPO 应用于 FullDiT 以提高音乐性和渲染质量。多语言自动基准测试的实验结果,辅以人工分析音乐与人声排行榜,表明所提出的框架在评估的设置中实现了具有竞争力的性能。