论文
扩展音乐标注:零样本预测与少样本适配的预算比较
Extending Music Annotation Schemas: Zero-Shot Prediction or Few-Shot Adaptation?
摘要
自动音乐注释通常是在固定注释模式的假设下解决的。在实践中,商业音乐目录通常需要随着需求的发展而适应新的音乐属性。鉴于专家音乐注释的成本很高,目前尚不清楚哪种方法在适应新属性和回填现有曲目方面最有效;音频语言模型承诺零样本预测,但是在多少标注预算下,监督适应会变得更加引人注目?我们提出了一个基于 MGPHot 流行音乐注释数据集的基准,用于模拟跨不同标注预算的音乐模式扩展。我们研究使用音频语言模型的零样本预测,从预训练的表示中学习新属性,并调整根据现有注释训练的模型。我们的结果表明,即使标注预算较小,监督适应也比零样本预测更有效,而冻结表示重用仍然是适度预算的最有效方法,而无需进行更深层次适应所需的调整。
