论文

音乐生成模型理解音乐品质吗?使用模型固有信号进行自动音乐评估

Do Music Generative Models Understand Musical Qualities? Automatic Music Evaluation with Model-Intrinsic Signals

模型评测模型行为与机制分析

摘要

当前的音乐生成模型可以产生高质量的音乐,但这种能力是否意味着它们“理解”其输出的音乐品质,并且这种理解是否与人类的评估一致?先前尝试使用生成模型的可能性来评估音乐(一种文本中常用的方法)已被证明是不成功的,导致研究人员依赖于独立的监督音乐评估模型。在本文中,我们肯定地回答了这个问题:我们表明模型的内在信号(源自其隐藏的表示和预测)与人类评分密切相关。特别是,我们研究 MusicGen 并考虑三种类型的特征:(1)预测损失,(2)预测熵,以及(3)使用稀疏自动编码器(SAE)从模型中提取的概念。利用这些特征,我们训练一个轻量级预测模型来估计主观评分。我们单独或组合评估这些特征。我们假设这些信号与聆听过程平行:损失和熵的时域和频域结构反映了听众的期望和惊喜,而 SAE 潜在空间中的梯度方向则预测感知质量。对涵盖连续评级和成对偏好的五个人类评估基准进行的实验证实了这一假设,其中 SAE 潜伏携带了大部分预测信号。