论文
不要只看 CLAP:音乐文本评分可能接近词袋
Don't CLAP: Are Music-Text Models Bag-of-Words?
摘要
文本到音乐系统根据音频质量以及音乐遵循提示的忠实程度进行评估,而 CLAP 分数(音乐文本模型的音频和文本嵌入之间的余弦相似度)是忠实度的标准客观指标。我们询问该评分反映文本的准确程度:当属性链接到乐器(例如,失真吉他)时,文本嵌入是否捕获该绑定?为了找到答案,我们引入了属性交换扰动:通过在两个乐器之间精确交换一个属性、音色、主奏与伴奏或首次出现的顺序来编辑真实录音的描述。然后,我们测试了四种对比音乐文本模型和一种大型音频语言模型,以确定音频相对于原始描述的得分是否高于相对于受到干扰的描述的得分。没有对比模型能够可靠地区分这两个描述。音频语言模型做得更好,但进一步的实验表明,它的优势很大程度上取决于不依赖音频的语言先验。因此,我们的结果提供了令人信服的证据,证明 CLAP 分数和相关指标并未捕获细粒度的音乐含义或属性绑定;它们的表示更接近于词袋,这使得它们对描述的意义改变扰动不敏感。