论文
音乐基础模型哪层更好?逐层表征质量分析
What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models
摘要
音乐基础模型通常用作冻结音频特征提取器,但选择从哪一层提取仍然很大程度上是启发式的。当前的实践默认采用固定深度或多层融合,但对为什么某些层能够更好地跨下游任务传输或表示质量如何随深度和 预训练 范式变化的理解有限。我们对涵盖三个 预训练 范式(掩模建模、自回归建模和对比学习)的 12 个音乐基础模型进行了系统的分层分析,通过内在的几何和基于变换的属性来表征它们的隐藏表示。将无标签表示质量指标与 15 个下游任务的分层性能相关联,我们发现有几个指标跟踪流派分类、情感识别、自动标记和节拍跟踪的层质量,尽管不同任务和 预训练 范例的强度不同。然而,所有指标在调性估计和和弦识别等音调任务上都失败了,这表明没有任何单一属性可以作为跨音乐信息检索任务的表示质量的通用代理。为了解决这一差距,我们引入了一种音调换位等方差测量,可以捕获这些标准指标所遗漏的属性,从而提供跨模型系列的音调质量的一致指标。最后,我们表明内在指标可以作为层选择、匹配或优于可训练多层融合方法的有效代理,特别是在有限数据设置中。