论文
SPHERE:通过具有空间启发式奖励的音频语言模型 后训练 自动音乐上混
SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards
摘要
在本文中,我们研究了自动音乐上混音的任务,其中系统从多干录音中预测空间混音参数。与依赖特定于任务的音乐编码器的现有方法不同,我们通过音频语言模型(ALM)后训练 来完成此任务,利用现有 ALM 的丰富表示,对音乐语义和混合知识进行编码。具体来说,我们提出了一个 后训练 配方,首先采用拒绝采样 SFT,然后通过 GRPO 进行具有可验证奖励 (RLVR) 的强化学习 (RL)。我们提出 Sphere(空间启发式奖励),这是一种受音乐混合惯例启发的确定性奖励套件,来指导我们的 后训练。它由 6 个感知驱动的子奖励组成,鼓励输出组合集中、平衡和宽敞。更广泛地说,我们的结果表明,专家领域知识可以被编码为可验证的奖励,并提炼成语言模型,而无需特定于任务的架构。