论文

蒙面对比 预训练 改进音乐音频音调检测

Masked Contrastive Pre-Training Improves Music Audio Key Detection

模型评测模型能力评测

摘要

自监督音乐基础模型在调检测方面表现不佳,这需要对音调敏感的表示。在这项工作中,我们提出了第一个系统研究,表明自监督预训练的设计直接影响音高灵敏度,并证明掩蔽对比嵌入能够独特地在监督环境中的关键检测中实现最先进的(SOTA)性能。首先,我们发现对梅尔谱图进行基于掩蔽的对比预训练后的线性评估可以带来开箱即用的音乐调检测的竞争性能。这使得我们可以根据从基础模型中提取的特征来训练浅但宽的多层感知器 (MLP),从而无需复杂的数据增强策略即可实现 SOTA 性能。我们进一步分析鲁棒性,并凭经验证明学习到的表示自然地编码常见的增强。我们的研究将自我监督预训练确立为音高敏感 MIR 任务的有效方法,并为设计和探索音乐基础模型提供了见解。