论文

从分类到推荐:基于内容的音乐推荐的音频嵌入模型应用实证分析

From Classification to Recommendation: Empirical Analysis of Audio Embedding Models Application for Content-Based Music Recommendation

模型评测模型能力评测

摘要

从大规模语料库中学习的预训练音频表示模型在音频分类和理解方面取得了强大的性能。然而,大多数现有模型都针对屏蔽预测、对比学习或音频文本对齐等目标进行了优化,这些目标不一定会产生非常适合推荐系统的表示空间。与分类不同,音乐推荐系统必须捕获由主观和行为相关的听众偏好形成的项目关系。尽管预训练音频嵌入已经在传统推荐系统中进行了探索,但它们在快速新兴的生成推荐系统范式中的有效性仍未得到充分探索。为了解决这一差距,我们系统地评估了三种类型的音乐推荐系统中的六种代表性音频编码器:基于内容的、顺序的和基于语义 ID 的生成推荐系统。我们进一步研究残差量化设计(包括码本宽度、量化深度和保留的语义 ID 前缀)如何影响推荐相关信息的保存。对两个音乐推荐数据集的实验表明,直接使用预训练的嵌入几何图形时,音频文本对齐和音乐域表示通常更有效,而基于交互的顺序训练大大减少了编码器之间的性能差异。我们还发现,增加语义 ID 容量并不能持续改善生成推荐系统,并且可能会带来严重的不稳定。这些发现为选择音频编码器和为现代音乐推荐系统设计音频衍生语义 ID 提供了实用指导。