论文

StemFX:通过源分离 Stem 上的自回归 FX 链预测来学习混合风格表示

StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems

应用与实践内容创作

摘要

音频混合风格包含混音工程师做出的艺术和技术决策,包括电平平衡、空间化以及每个主干上音频效果 (FX) 的选择、排序和参数化。外汇链是这种风格的关键决定因素,但现有的建模方法仍然有限。有些对立体声混合进行操作,而无需明确的每根 FX 链建模,其他则固定每个轨道的效果数量或类型,许多需要可微分的效果实现或稀缺的多轨数据集。我们提出了 StemFX,这是一个通过自回归预测源分离茎上的可变长度 FX 链来学习混合风格表示的框架。 Transformer 解码器以自回归方式预测标记化 FX 链,而具有 FiLM 调节功能的频带分割多频带 CNN 编码器则捕获每个茎的频谱结构。为了实现大规模配对训练,我们通过源分离从大约 105K 首歌曲中提取伪词干,并使用 MultiAFx(一个统一来自 7 个 Python 库的 85 种音频效果的工具包)对其进行增强。在混合风格检索方面进行评估,StemFX 在所有测试的链长度上均优于所有基线模型。在配对混音风格传输中,StemFX 实现了最佳的频谱保真度和最高的听众偏好,比迭代优化快 4000 倍以上。