论文

生成音乐模型遵循情绪调节的效果如何?

How Well Do Generative Music Models Follow Emotion Conditioning?

模型评测评测方法与指标

摘要

最近的生成音乐模型通过文本和音频调节提供了越来越细粒度的控制,但它们如何忠实地遵循预期的情感线索仍然是一个悬而未决的问题。我们通过在生成的音乐中进行情感跟踪的统一评估管道来解决这一差距。使用 GTZAN 中的所有 1000 首曲目,我们使用 DashengLM(一种音频字幕模型)提取语义音频描述,并使用 Music2Emotion(一种音乐情感识别模型)估计源曲目效价和唤醒度。我们通过将描述与排名最高的情感标签相结合来构建情感感知文本提示,并使用三个系统(Stable Audio Open、MusicGen 和 InspireMusic)生成 30 秒的输出,评估文本和音频调节的生成。为了测量情绪跟随,我们计算生成的音频的价和唤醒,并使用价唤醒空间中的绝对误差和欧几里得距离将它们与源音轨进行比较。文本调节生成始终优于音频调节,其中 MusicGen(文本)和 InspireMusic(文本)实现了最佳性能,而音频调节变体则不太稳定。我们进一步发现效价比唤醒更可靠地保存,并且情感跟随在不同类型之间存在很大差异。这些发现强调了直接评估情感可控性的重要性,而不是仅仅依赖一般质量或即时相关性指标。