论文
MuSViT:乐谱表示的基础视觉模型
MuSViT: A Foundation Vision Model for Sheet Music Representation
摘要
基础模型通过提供丰富的、可重复使用的、跨不同任务的表示来改变视觉和语言处理。乐谱作为音乐语言的视觉编码,缺乏如此强大的特定领域的支柱。我们介绍 MuSViT (Music Score Vision Transformer):第一个用于乐谱表示的基础视觉模型 - 通过 Masked Autoencoders 在 IMSLP 的 970 万页上进行预训练的 ViT 编码器。为了处理现实世界乐谱的复杂性,我们采用了两阶段课程:对排版乐谱进行综合热身,然后对完整 IMSLP 语料库进行大规模训练。我们在线性探测(冻结编码器)和 微调 两种场景下对四个下游任务(全页和五线谱级乐谱识别、音乐符号检测和乐谱难度分类)评估 MuSViT。在线性探测下,MuSViT 始终优于现代视觉编码器,这表明通用表示,无论规模如何,都系统地缺乏乐谱的结构化符号属性。在 微调 下,MuSViT 通常改进了特定于任务的最先进方法。额外的嵌入转录一致性分析表明,MuSViT 直接在其表示空间中编码符号音乐结构 - 与其他编码器不同,其他编码器的嵌入与音乐符号内容不相关。这些结果使 MuSViT 成为理解乐谱的基础支柱。