论文
MuQ-Eval:用于 AI 音乐生成评估的开源逐样本质量指标
MuQ-Eval: An Open-Source Per-Sample Quality Metric for AI Music Generation Evaluation
摘要
Fréchet Audio Distance 等分布层面指标无法对单个音乐片段打分,且与人类判断相关性差;而唯一实现高人类相关性的逐样本学习型指标却是闭源的。我们提出 MUQ-EVAL,一个面向 AI 生成音乐的开源逐样本质量指标:在冻结的 MuQ-310M 特征上训练轻量预测头,训练所用 MusicEval 数据集包含来自 31 个文生音乐系统、带专家质量评分的生成片段。我们最简单的模型——冻结特征加注意力池化和两层 MLP——与人类平均意见得分达到系统级 SRCC = 0.957、语句级 SRCC = 0.838。对训练目标与适配策略的系统性消融表明,任何附加组件都无法显著改进冻结基线,说明冻结的 MuQ 表示已经捕获了与质量相关的信息。编码器选择是主导性的设计因素,其影响超过所有架构与训练决策。仅用 150 个片段训练的 LoRA 适配模型即可达到可用的相关性,从而能够基于个体听者的标注构建个性化质量评估器。受控退化分析揭示出其对信号级伪影具有选择性敏感,而对音乐结构层面的失真不敏感。我们的指标 MUQ-EVAL 完全开源,优于现有开放的逐样本指标,并可在单张消费级 GPU 上实时运行。代码、模型权重和评估脚本见 https://github.com/dgtql/MuQ-Eval。
