论文

用于会话音乐推荐的具有约束 LLM 重排序的多模态语义扩展

Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation

上下文与知识检索增强

摘要

我们展示了 Semiintelligencn 团队针对 ACM RecSys 2026 TalkPlayData 挑战赛的解决方案,通过多模式和个性化的对话式推荐系统解决对话式音乐推荐问题。我们提交的系统采用三阶段管道:(1) 跨七个密集嵌入空间构建衰减加权质心的多模态检索 - 轨道和用户级 CF-BPR、Qwen3(元数据、歌词、属性)、CLAP 音频和 SigLIP 视觉 - 辅以 BM25 词汇检索和艺术家子串匹配信号,所有这些都通过加权倒数排名融合 (RRF) 与优化的信号权重进行融合; (2)轻量级重排序(历史过滤、流行度平滑、目录多样性惩罚); (3) 使用 GPT-4o-mini 生成角色多样化的响应。除了这个提交的配置之外,我们还报告了使用其他组件的开发时实验 - 受约束的 LLM 引导的艺术家注入、专辑延续信号、XGBoost LambdaMART 和卓越的 GPT-4.1 响应提示 - 由于成本和复杂性限制,这些组件没有部署到 Blind B。我们通过差分进化优化了 500 个会话开发拆分的 RRF 权重,将 MRR 提高了 +19.5%。在 Blind A 中,我们观察到在 54 个会话中不受约束的 LLM 引导注射会导致灾难性的 nDCG 回归 (-18.9%),而仅 9 个会话的保守注射产生了最佳观察到的 Blind A nDCG - 我们将这一发现作为 Blind A 观察结果提出,需要进一步验证。提交的系统的 Blind B 综合得分为 0.3213。