论文

FigMA:迈向细粒度音乐检索

FIGMA: Towards FIne-Grained Music retrievAl

模型训练预训练

摘要

使用自然语言描述检索音乐已通过 CLAP 等对比音频文本模型得到改进,但当前系统仍仅限于粗略语义查询。当描述指定细粒度的音乐属性(例如节奏、调、和弦进行或节奏结构)时,现有模型通常无法检索正确的音频。我们表明,这种限制源于对比学习目标本身:尽管接受了长标题的训练,但基于 CLAP 的模型仅有效地利用了前几个标记,丢弃了详细提示中编码的大部分信息。然后,我们提出了FigMA(细粒度音乐检索),这是一种多视图对比架构,通过联合优化全局音频文本对齐和帧级、标记式对齐来解决这一限制。这种设计使Figma能够在统一的表示空间内捕获高级语义上下文和细粒度的音乐属性。此外,我们形式化了细粒度音乐检索的任务,并构建了细粒度音乐字幕数据集(FGMCaps),这是一个包含 380K 音乐字幕对的大型数据集,用于训练以及 10K 测试集,两者都注释有节奏、调、和弦进行、节拍数以及流派和情绪。大量实验表明,FIGMA 在多个音乐检索基准(包括域外评估)中始终优于现有的基于 CLAP 的音乐检索模型,相对改进高达 73.3%。