论文
知道何时不回答:音乐音频语言模型中弃权的伪集合
Knowing When Not to Answer: Pseudo-Ensembles for Abstention in Music Audio-Language Models
摘要
音乐音频语言模型几乎完全通过多项选择题的准确性来评估。该协议迫使模型做出选择,因此幸运的猜测看起来与真正的音乐理解相同。缺少的是一种告诉模型何时不知道答案的方法,以便它可以放弃而不是猜测。通常的解决方案是独立训练的模型的集合,在这里过于昂贵,这使得单个预测分布的熵成为唯一可用的置信信号。相反,我们通过以无法改变正确答案的方式扰动其输入,从一个预训练模型构建伪集成,然后对选项的结果分布进行平均。我们的主要结构只是简单地打乱候选答案的呈现顺序;我们还研究由损坏的音频和交换的选项标签构建的合奏。伪集成为每个问题提供了多个预测分布,因此它支持基于集成的不确定性度量的完整系列(预期分布的熵、预期熵及其差异、互信息),而不是单独的熵。在 MuChoMusic 上评估 TinyMU,我们发现对四个选项排序进行平均可以将准确度从 55.7% 提高到 59.2%,并且由此产生的不确定性度量对模型错误的排序优于单通道熵基线,从而将错误保留曲线下的面积从 0.293 减少到 0.261。所有这些都需要一些额外的前向传递并且不需要重新训练,这使得弃权对于紧凑的音乐音频语言模型来说非常实用。