论文
将音乐建模为时频图像:用于音乐生成的 2D 分词器
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
摘要
自回归音乐的生成很大程度上取决于音频标记器。现有的高保真编解码器通常使用残差多码本量化,这可以保留重建质量,但会使序列扁平化后的语言建模变得复杂,因为残差层次结构强加了强顺序依赖性,并且会放大错误累积。我们提出了 BandTok,一种面向生成的 2D Mel 频谱标记器,它用来自单个共享码本的 Mel 频带标记表示每个帧。这种设计产生了一个物理上可解释的时频词元网格,具有更独立的词元结构,使其更适合自回归建模。 BandTok 通过多尺度 PatchGAN 目标和 EMA 码本更新改进了重建。我们进一步引入了具有 2D 旋转位置嵌入 (2D RoPE) 的自回归语言模型,以在生成过程中保留时间和频带结构。实验表明,BandTok 改进了残差码本分词器,并在数据有限的环境中取得了出色的结果。这项工作的源代码和生成演示是公开的。