基础模型能听到是什么发出的声音吗?用于闭集声源识别的音频语言模型和传统分类器的分层基准
Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification
摘要
我们对十一种音频分类方法进行了基准测试:五个任务感知封闭集 LLM(四个 Gemini 模型加上开放权重 Kimi-Audio-7B-Instruct)、四个固定词汇标注器(YAMNet、PANN、Whisper-AT 和 SSLAM)、一个零样本音频文本模型 (CLAP) 和一个基于音频的 LLM (BAT)。我们在涵盖 23 个细粒度类别和 11 个类别的 2,242 个剪辑的封闭集声源识别任务中对它们进行了评估。由于这些方法在如何接收任务以及如何对输出进行评分方面存在根本差异,因此我们将它们分为四个评估层而不是一个排行榜,报告每层的宏观精度、召回率、F1 和假阴性率。最好的模型 Gemini-3.1-Pro-Preview 达到了 85.6% 的类别级 F1 和 56.7% 的细粒度 F1。 Kimi-Audio 的规模具有竞争力,达到了 67.5% 的类别级 F1 和 32.9% 的细粒度 F1,但无法回答 1.6% 的样本。 SSLAM 和 CLAP 在类别级别匹配或超过最佳闭集模型,而无需查看候选列表,但在细粒度级别落后。通过分析 Gemini 模型在 8,968 个回答中的思维链,我们发现回答长度并不能预测准确性,明显的“整体判断胜过详细分析”效应可以更好地解释为困难混淆,并且 92% 到 100% 的情况下会自信地说出错误答案。我们报告了所有十一种方法的完整的每类混淆矩阵和指标,确定了粒度之间大多数准确性损失背后的结构错误模式,并为在这些方法系列中进行选择提供了实用指导。