论文

文本到音乐模型真的遵循说明吗?对调和节拍分组的反事实评估

Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping

模型评测评测方法与指标

摘要

提示属性一致被广泛用作文本到音乐可控性的证据,但所请求的属性可能仅仅因为它在模型的输出分布中已经很常见而出现。我们引入了匹配的反事实评估,将目标发生与指令归因控制分开。每个系列包含一个忽略评分属性的中性输入和两个交换所请求目标的其他匹配输入。所有这三个都是通过具有共享种子的冻结本机接口适配器呈现的。应用于三个开放系统中的全局调和节拍分组,该设计改变了经验结论。 ACE-Step 1.5 和 Stable Audio 3 Medium 表现出强大的按键控制能力,而 LeVo2 则不然。对于节拍分组,相同的模型重定向到罕见的三节拍目标,但高四节拍一致性很大程度上继承自中性输出:Stable Audio 3 在 0.97 的中性情况下产生四节拍分组,但在其明确的四节拍处理下仅产生 0.56。非属性安慰剂、外部识别器验证、盲专家注释和多种子哨兵支持归因。当目标具有不平等的输出先验时,协议描述了模型产生的内容,而匹配的中性和目标交换对比则测试指令是否改变了模型。