论文

采用最先进的预训练音频表示形式进行音乐推荐系统

Adopting State-of-the-Art Pretrained Audio Representations for Music Recommender Systems

模型评测模型能力评测

摘要

多年来,音乐信息检索(MIR)研究社区发布了各种基于大量音乐数据进行预训练的模型。迁移学习展示了预训练后端模型对于广泛的下游任务(包括自动标记和流派分类)的有效性。然而,MIR 论文通常不会探讨音乐推荐系统 (MRS) 预训练模型的效率。此外,推荐系统社区倾向于传统的端到端神经网络训练。我们的研究解决了这一差距,并评估了 MRS 背景下九种预训练后端模型(MusicFM、Music2Vec、MERT、EncodecMAE、Jukebox、MusiCNN、MULE、MuQ 和 MuQ-MuLan)的性能。我们使用五种推荐方法对其进行评估:K 最近邻 (KNN)、浅层神经网络、对比多模态投影、混合模型以及适用于热启动和冷启动场景的 BERT4Rec。我们的研究结果表明,预训练的音频表示在传统 MIR 任务与冷热音乐推荐之间表现出显着的性能差异,这表明后端模型捕获的音乐信息的有价值的方面可能因任务而异。这项研究为进一步探索预训练音频表示以增强音乐推荐系统奠定了基础。