论文
通过开放词汇概念发现引导密集音乐检索
Steering dense music retrieval with open-vocabulary concept discovery
摘要
可控的音乐检索让用户可以找到更具环境氛围、更少失真或没有吉他的音乐,同时保留原始种子查询的其他语义内容。稀疏自动编码器(SAE)是这种概念级控制的一个有前途的接口,但仍然存在一个关键问题:给定自由格式的文本概念,应该编辑哪些稀疏特征?在共享多模态嵌入空间中,标准归因方法通常选择与概念的措辞匹配的神经元,但不选择与表达概念的音频示例匹配的神经元。这会导致编辑较弱或不稳定:当概念分布在神经元之间时,相关特征会被遗漏,而其他特征则由于文本对齐而不是音频侧结构而被选择。我们使用轻量级的 无需训练 方法来解决这个问题,该方法恢复一组稀疏的音频特征,其解码表示重建目标概念,同时与音频空间几何保持一致。这将概念归因重新构建为稀疏反演问题,而不是文本侧神经元排名启发式问题。该方法既不需要配对的音频文本监督,也不需要 SAE 重新训练。我们在可操纵的音乐检索中评估了这种方法,并表明恢复的支持与具有概念的音频示例更紧密地对齐,并且与对齐基线相比,在编辑强度和保留之间实现了更强的权衡,从而实现了更精确的概念放大和抑制,同时减少了保留指标的漂移。