论文
BMdataset:音乐学策划的 LilyPond 数据集
BMdataset: A Musicologically Curated LilyPond Dataset
摘要
符号音乐研究几乎完全依赖基于 MIDI 的数据集; LilyPond 等基于文本的雕刻格式在音乐理解方面仍未得到探索。我们提出了 BMdataset,这是一个音乐学策划的数据集,包含 393 个 LilyPond 乐谱(2,646 个乐章),由专家直接根据原始巴洛克手稿转录,元数据涵盖作曲家、音乐形式、乐器和乐段属性。在此资源的基础上,我们引入了 LilyBERT(权重可在 https://huggingface.co/csc-unipd/lilybert 上找到),这是一种基于 CodeBERT 的编码器,通过使用 115 个 LilyPond 特定标记和掩码语言模型 预训练 进行词汇扩展,适应符号音乐。对域外 Mutopia 语料库的线性探测表明,尽管其大小适中(约 90M 个标记),但在作曲家和风格分类方面,BMdataset 上的 微调 单独优于完整 PDMX 语料库(约 15B 个标记)上的连续 预训练,这表明,在音乐理解方面,经过专业整理的小型数据集比大型嘈杂语料库更有效。将广泛的 预训练 与特定领域的 微调 相结合可产生最佳的总体结果(84.3% 的作曲家准确度),从而确认这两种数据机制是互补的。我们发布了数据集、分词器和模型,为 LilyPond 上的表示学习建立基线。