论文
使用预先训练的特征、数据增强和新的 SheetSage-A2S 数据集进行音频到乐谱转录
Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
摘要
现有的音频乐谱(A2S)系统主要关注古典音乐,而在流行音乐中的应用仍未得到充分探索。本文首先介绍了新的 SheetSage-A2S 数据集,其中包括 61 小时的音频,其中包含来自 6,066 首独特歌曲的 9,468 个剪辑的 **kern 乐谱编码,这是第一个促进流行音乐 A2S 研究的数据集。此外,我们通过使用数据增强和 MuQ(一种用于音乐音频的预训练特征提取模型)改进了现有的 A2S 方法,以增强泛化能力并提取有意义的音频特征。结果表明,所提出的 A2S 模型在古典音乐四重奏集上实现了 4.98% 的符号错误率 (SER),这明显优于现有最先进技术的 15.3% SER(Alfaro-Contreras 等人,2024)。此外,我们的模型在流行音乐的 SheetSage-A2S 数据集上实现了 20.92% 的 SER,为未来的研究提供了强有力的基准。数据集、模型和代码公开于:https://github.com/Multimodal-Music-Research-Lab/SheetSage2Kern_model。