论文
HAFM:音乐伴奏生成的分层自回归基础模型
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
摘要
音乐伴奏生成旨在自动生成与给定的声音输入在节奏、和声和音色上一致的乐器伴奏,在个性化音乐创作、编曲辅助和音乐教育方面具有广泛的应用。现有的方法主要在符号域中运行或依赖于单级音频生成框架,通常存在高级语义结构建模不足、声学细节重建有限和条件可控性弱的问题。为了解决这些局限性,本文提出了 HAFM,一种用于生成声乐条件音乐伴奏的分层自回归基础模型。该模型采用双速率标记化策略,其中 50 Hz HuBERT 语义标记捕获高级音乐结构,而 75 Hz EnCodec 声学标记编码细粒度声学内容,从而实现语义和声学表示的明确分离。在此基础上,设计了一个三阶段级联生成框架,逐步生成语义标记、粗声学标记和精细声学标记,从而细化从全局结构到局部细节的伴奏。 。对 MUSDB18 数据集的客观评估表明,完整的三阶段模型的 Fr{é}chet 音频距离 (FAD) 得分为 1.71,比两阶段基线 (FAD = 2.10) 相对提高了 18.6%。主观听力测试表明,在头对头比较中,生成的伴奏相对于 真值 伴奏达到了 51.5% 的偏好率,并且在节奏对齐、和声兼容性和整体音乐连贯性方面远远优于随机基线。源代码和演示可在 https://github.com/HackerHyper/HAFM.git 获取。