论文

Shao:将声学词元语言模型扩展到高保真音乐生成

Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

应用与实践内容创作

摘要

高质量音乐生成的常见设计模式是处理不同表示空间中的结构和保真度:生成器首先对高级结构进行建模,然后是基于扩散或神经解码阶段来重建精细细节。在这项工作中,我们探索了另一种观点:两者都可以在单个深层声学词元层次结构中逐步建模。为了研究这个问题,我们构建了一个 64 层残差矢量量化 (RVQ) 声学表示,并提出了一个两阶段从粗到细的生成框架。主干模型首先为整个音轨生成粗略的声学标记,然后超分辨率模型在相同的声学标记空间内完成更精细的标记。超分辨率阶段在全轨规模下工作,并逐层细化标记,同时随着时间的推移并行运行,从而形成固定的 62 步推理过程。为了共同改进歌词对齐和精细细节重建,我们进一步引入混合注意力训练:对齐目标使用因果注意力,而分层细化使用充分注意力。一个重要的发现是,文本-语音对齐可以出现在纯声学标记语言模型中,而不需要单独的语义标记阶段。此外,从经过训练的骨干网初始化超分辨率模型可以显着提高收敛性和最终质量。综上所述,我们的结果表明,无需将结构和保真度分离到异构表示空间中,就可以有效地追求高质量的音乐生成。相反,两者都可以在统一的声学词元层次结构中逐步建模,从而指向更简单、更统一的高质量音乐生成路径。