论文
互联网档案音乐数据集
The Internet Archive Music Dataset
摘要
我们介绍互联网档案音乐数据集 (IAMD),这是源自互联网档案的带字幕音乐片段的大规模集合。据我们所知,IAMD 构成了迄今为止最大的公开音乐字幕数据集,包含超过 34,000 小时的音频,为训练和评估音乐理解和生成模型提供了宝贵的基准。该数据集是根据声明在知识共享许可下分发的内容构建的,并与 MusicBrainz 进行交叉引用以提高许可信息的可靠性。为了注释 IAMD,我们提出了一个自动字幕管道,该管道使用来自互联网档案馆的文本元数据和使用音频分类模型获得的估算元数据来增强音频语言模型 (ALM) 生成的基本字幕。字幕质量经过客观和主观评估,结果表明注释管道是可靠的,并且不会因缩放而降低字幕质量。