论文
SpurAudio:研究少样本音频分类中快捷学习的基准
SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification
摘要
少样本分类(FSC)广泛用于从有限的标记数据中学习,但大多数评估隐含地假设目标概念独立于上下文线索。然而,在现实世界中,示例通常出现在丰富的上下文中,从而允许模型利用前景内容和背景信号之间的虚假相关性。虽然这种效应已经在少样本图像分类中进行了研究,但它们在少样本音频分类中的作用在很大程度上仍未被探索,并且现有的音频基准对上下文结构的控制有限。我们引入了 SpurAudio,这是一个基准,它利用音频中前景事件和背景环境的自然可分离性,以实现跨支持和查询集的上下文变化的受控、多级评估。使用这个基准,我们表明,尽管在标准评估协议下实现了类似的准确性,但当背景相关性被破坏时,许多最先进的少样本方法会遭受严重的性能下降。至关重要的是,即使在大型预训练音频基础模型中,该漏洞仍然存在,排除了骨干容量有限的解释。此外,在传统基准下看起来具有可比性的方法可以对虚假相关性表现出明显不同的敏感性,揭示与特征表示在推理时如何与分类器头交互相关的系统算法优势和漏洞。这些发现为音频中少样本方法的行为提供了新的见解,并强调了在评估 FSC 模型时明确探测上下文依赖性的基准的必要性。