论文

MuChator:通过抖音音乐中的会话音乐 LLM 实现主动音乐发现

MuChator: Enabling Active Music Discovery via Conversational Music LLMs in Douyin Music

摘要

抖音音乐是一个拥有数百万日常用户的大型平台,采用沉浸式、基于信息流的发现范式,用户通过持续推荐被动地探索音乐。虽然对于被动音乐发现有效,但这种范例限制了用户的推荐结果,并对明确指定收听意图提供了有限的支持。与传统搜索不同的是,用户通过明确的查询(例如特定歌曲或艺术家)来表达明确的意图,而现实世界的主动音乐发现通常是情境性和口语化的,涉及模糊或未指定的请求。虽然 LLM 支持自然语言交互,但它们在音乐发现中的直接使用仍然受到音乐领域知识不足、缺乏音乐查询协作推理以及对个性化偏好理解浅薄的限制。为了应对这些挑战,我们引入了 MuChator,这是一个基于 MusicLLM 的交互式框架,使用户能够用自然语言主动表达情景音乐意图。 MuChator包含三个关键组成部分:(1)音乐知识预训练,一个三阶段方案,将客观音乐知识、主观音乐知识和个性化音乐偏好逐步注入LLM; (2) 上下文感知指令调整,通过自动合成管道构建高质量的用户查询音乐三元组,以使 LLM 与主动和情境用户意图保持一致; (3) 与 Hybrid RM 的偏好对齐,联合建模意图相关性、个性化偏好和基本约束,并使用基于 GRPO 的强化学习进行优化。对工业音乐推荐数据集的广泛评估表明,MuChator 的性能优于领先的专有模型,例如 Gemini-3-Pro。该模型已部署在字节跳动抖音音乐App上,在线A/B测试中用户活跃天数提升46.49%。