论文

内容音乐检索:将策展反馈分别路由至约束与嵌入层

Nearest but Not Dearest: Shared Curator-Feedback Infrastructure for Content-Only Search and Recommendation

上下文与知识检索增强

摘要

部署的 B2B 音乐发现平台通过一个许可目录、一个 LAION-CLAP 联合音频文本嵌入空间、一个候选生成过滤器和一个排名头,同时提供查询驱动的搜索(文本提示、氛围标签)和种子驱动的推荐(种子曲目和艺术家电台),并且这两种路径都不会消耗最终听众的行为信号。在这种仅包含内容的体制中,策展人的判断是可用的主要反馈信号,而离线余弦相似度对其预测效果很差:38% 的余弦最近邻被策展人拒绝。拒绝结果显示出一个清晰的划分:大多数(55%)是编码器可以解决的声音故障(风格、节奏、情绪不匹配),而少数(37%)是与波形正交的上下文故障(错误的语言、节日内容、灵修内容、权利和歌词标记)。我们将这种声音与上下文的分解部署为反馈基础设施,将每个故障模式路由到可以吸收它的层:候选生成时的约束过滤器的上下文故障,表示层的嵌入重新加权头的声音故障——两者都位于搜索/推荐分割下方,因此单个策展人循环可以维护这两种体验。根据在相隔一个月的两轮生产中收集的 1,200 个策展人判断,综合干预将拒绝率从 38.17% 降低到 28.83%(-24.5% 相对,麦克尼马尔卡方 = 22.4,p = 2.2e-6)。账面分解将 4.08 个百分点 的下降归因于符合过滤条件的类别,5.25 个百分点 归因于其余类别;该部署是非盲且复合的,因此这是生产核算范围,而不是因果估计。我们将其作为工业案例研究而不是经过验证的通用方法来呈现,并以仅内容发现的教训作为结尾:故障分区与范式分区正交,并且修正位于两个范式共享的层中。