论文
通过神经音频编解码器从富有表现力的鼓网格进行鼓合成
Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs
摘要
在音乐感知和机器学习的交叉点上,直接从符号表示生成逼真的鼓音频是一项具有挑战性的任务。我们提出了一个系统,通过预测神经音频编解码器的离散代码,将富有表现力的鼓网格(具有微计时和速度信息的时间对齐 MIDI 表示)转换为鼓音频。我们的方法使用基于 Transformer 的模型将鼓网格输入映射到一系列编解码器标记,然后通过预先训练的编解码器解码器将其转换为波形音频。我们尝试了多种最先进的神经编解码器,即 EnCodec、DAC 和 X-Codec,以评估音频表示的选择如何影响生成的鼓的质量。该系统在 Expanded Groove MIDI 数据集 (E-GMD) 上进行训练和评估,E-GMD 是具有配对 MIDI 和音频的人类鼓演奏的大型集合。我们使用客观指标评估生成音频的保真度和音乐一致性。总的来说,我们的结果将编解码器词元预测确立为鼓网格到音频生成的有效途径,并为选择用于打击乐合成的音频词元生成器提供了实用的见解。