论文
优点:学习解开的音乐表示以实现音频相似性
MERIT: Learning Disentangled Music Representations for Audio Similarity
摘要
当前的音乐相似性模型通常计算单个整体评分,将旋律、节奏和音色等不同的音乐维度纠缠在一起。这限制了用户的控制和可解释性,使得无法执行细致入微的查询。我们引入了 MERIT,一个用于学习针对这三个核心维度量身定制的、解开的、特定因素的音乐表征的框架。为了克服现实世界音频中缺乏孤立的音乐变化的问题,我们使用了一种新颖的训练策略,该策略使用条件音频生成和源分离的词干来强烈鼓励训练数据中的单因素变化。我们的评估表明,各个因素之间存在很强的分离性。每个头部对其预期的感知维度做出强烈反应,同时对其他头部保持接近机会,这是一种跨合成训练领域和独立现实世界音频的代表性属性。