论文
使用LLM的多模态音乐推荐系统
Multimodal Music Recommendation System using LLMs
摘要
音乐推荐系统通常将歌曲视为不透明的标记,依赖于忽略语义或声学内容的协作交互历史。之前的工作已经探索了 LLM 增强、多模态和文本增强的顺序推荐方法,虽然一些方法部分结合了语义、声学或参与信号,但没有一个方法在基于实际歌曲内容的推荐基于 LLM 的统一顺序推理框架内联合建模这三者。在这项工作中,我们提出了一个基于会话的音乐推荐的多模态框架,该框架通过三个互补信号丰富了 LastFM-1K 数据集:(1) 使用预训练的音乐和文本表示模型提取的音频和歌词嵌入,(2) 使用 MGPHot 注释模式生成 LLM 语义元数据,以及 (3) 收听完成率。我们采用 E4SRec 框架,通过多模态特征和不同项目 ID 编码器主干进行扩展,包括 SASRec、BERT4Rec 和 GRU4Rec。我们在零样本和微调设置中使用 LLaMa-2-13B、Qwen2.5-7B-Instruct 和 LLaMa-3-70B 进一步扩展了 LLM 主干选项。我们的实验表明,集成基于内容的特征比仅使用 ID 的基线在召回率方面提高了 95%,在 NDCG 方面提高了 79%。此外,我们的实验表明,朴素的多模态融合并不总是能产生附加改进,凸显了跨模态集成的挑战。我们发布了大规模的音乐推荐多模态基准。