论文
使用语言模型进行多干音乐源分离的离散标记建模
Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models
摘要
我们提出了一个用于多轨音乐源分离(MSS)的生成框架,该框架将任务重新表述为条件离散词元生成。与直接估计时域或频域中的连续信号的传统方法不同,我们的方法结合了基于Conformer的条件编码器、双路径神经音频编解码器(HCodec)和仅解码器的语言模型,以自回归方式为四个目标轨道生成音频标记。生成的词元通过编解码器解码回波形。对 MUSDB18-HQ 基准的评估表明,我们的生成方法实现了接近最先进的判别方法的感知质量,同时在人声轨道上获得了最高的 NISQA 分数。消融研究证实了可学习 Conformer 编码器的有效性以及顺序跨轨道生成的好处。