论文

当唱片公司忽略请求时:审核合成对话音乐推荐中策略选择的目标

When the Label Ignores the Request: Auditing Policy-Selected Targets in Synthetic Conversational Music Recommendation

模型评测评测方法与指标

摘要

LLM 管道生成的综合对话现在可作为完整的对话推荐基准:LLM 听众与 LLM 推荐者对话,对话中接下来记录的曲目将成为每个回合的官方标签。这些策略选择的标签使大规模评估具有可重复性,但它们是模拟用户要求的代理。我们审核标签和请求可直接比较的地方:用户按名称请求一首确切歌曲的地方。在 RecSys Challenge 2026 TalkPlay 基准测试中,仅使用可见对话和目录元数据,我们发现在审核的开发轮次中,官方标签与用户的确切歌曲请求相矛盾。这超出了一个基准:命名所需的项目是真实音乐搜索中的主要意图,其中部署的系统避免用替代品来替代确切命名的项目,前提是它会降低满意度。一个小的训练时间补充弥补了大部分差距:将目录解析的请求满足目标添加到一小部分训练回合中,在 43 个冲突回合中,nDCG@20 的相对增益为 53.3%,同时保持官方指标完整,并针对检测相同请求但仅在官方标签上进行训练的匹配控制进行验证。