论文

使用音频语言模型进行传导式零样本音频分类

Transductive Zero-Shot Audio Classification with Audio-Language Models

模型推理推理验证与自校正

摘要

对比语言音频预训练 (CLAP) 可实现零样本音频分类,但标准推理对每个剪辑进行隔离分类,并忽略未标记测试集的结构。我们提出了针对 CLAP 的 TransCLIP 式转导推理的第一个系统研究:一种文本锚定的球形高斯混合 EM,它使用测试批次的音频嵌入统计数据细化零样本后验,没有标签,没有梯度,计算量可以忽略不计(在一个 CPU 核心上处理 2,000 个剪辑大约需要 15 毫秒)。在 ESC-50、UrbanSound8K 和 VocalSound 中,与零样本基线相比,这始终将 top-1 准确度提高了 +4.6 至 +9.2 个点(例如,ESC-50 上为 89.1 -> 94.8%,UrbanSound8K 上为 73.8 -> 81.8%)。我们进一步表明,增益 (i) 受一个简单的操作边界控制——每批次每类大约需要 2.5 个测试样本,超过 ~5 后收益递减; (ii) 与熵引导即时加权相补充,在 ESC-50 上组合达到 96.2%; (iii) 在长尾批次下减弱但仍保持正值(20:1 不平衡时+4.9 -> +3.1 点),我们将其报告为明确的限制。我们还记录了一个负面结果:在 TUT Urban Acoustic Sc​​enes 2018 中,零样本 CLAP 几乎是偶然的,转导没有信号可以放大。