论文
频率感知自监督音乐表征学习
Frequency-Aware Self-Supervised Music Representation Learning
摘要
自监督学习 (SSL) 已成为音乐信息检索 (MIR) 的重要范例。虽然当前的 SSL 模型在各种 MIR 任务中实现了最先进的性能,但它们通常将音频视为一维序列,要么在时域波形上运行,要么在平坦的时频域频谱图上运行。这丢弃了时频表示中丰富的空间和结构信息,并忽略了音乐制作中的基本直觉。特别是,音乐在基于 MIDI 的工作流程中自然地表示为时频网格,这种结构与 2D 频谱图紧密对应,本质上使许多 MIR 任务变得微不足道。受这种直觉的启发,我们提出了 PupuM2D,这是一种直接在 2D 音乐频谱图上训练的音乐 Masked Modeling Duo (M2D) 模型。 PupuM2D 不是将屏蔽语言建模 (MLM) 应用于 1D 序列,而是通过预测来自未屏蔽上下文的屏蔽 2D 音乐频谱图块的潜在嵌入来学习稳健的表示。为了使这种框架最适合音乐信号,我们还对模型架构、训练方案和推理范式进行了特定领域的修改,并通过全面的消融研究证明了其有效性。对 MARBLEv2 基准的评估表明,PupuM2D 在线性探测中的多个 MIR 任务中优于基于序列的 SSL 模型。此外,注意力图的案例研究也证实 PupuM2D 捕获了 2D 时频域内具有音乐意义的模式。代码和检查点可在以下网址获取:https://www.yi Chenggu.com/PupuM2D/。