论文

MuseCritic:通过自然语言审美批评学习多方面的歌曲奖励

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

模型训练奖励建模与过程监督

摘要

长篇歌曲生成模型在持续时间、结构完整性和声学复杂性方面不断改进,使得可靠的美学奖励对于使这些模型与人类偏好保持一致变得越来越重要。然而,完整歌曲的奖励模型仍然有限,并且现有的评估器通常在单个前向传递中预测分数,而不提供可读的解释。我们引入了 MUSECRITIC,这是一种半标量奖励模型,它生成涵盖五个美学维度的自然语言批评,并将其用作预测连续奖励分数的中间表示。 MUSECRITIC 遵循两阶段训练流程:教师模型首先为监督 微调 提供高质量的批评,之后微调模型为奖励学习生成自己的批评,从而减轻训练和推理之间的分布变化。在包含 200 首 SongEval 歌曲的域内测试集上,MUSECRITIC 将宏观平均均方误差从 0.2875 降低到 0.2316,并将宏观平均 LCC、SRCC 和 Kendall's tau 分别提高到 0.9068、0.8838 和 0.7178。在包含 733 个偏好对的域外 Music Arena 基准测试中,它达到了 71.35% 的最高准确率。此外,将 MUSECRITIC 与 GRPO 结合使用,可以在 SongEval 和 Audiobox Aesthetics 的所有九个美学指标上改进 Muse-0.6B。这些结果表明,批评条件奖励模型减少了评分错误,并为歌曲生成提供了有效的优化信号。项目存储库位于 https://github.com/WuqnEl/MuseCritic。