论文
区分轴,而不是数据量:对比语料库如何教授音频嵌入
Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding
摘要
当对比表示缺乏属性时,缩放语料库是默认的补救措施。我们报告了一个它什么都不做的情况,并确定了它的作用:在基于冻结的多模态嵌入模型中添加词汇语音轮次将零样本关键字识别提高了 76 个点,同时将语音情感识别降低了 14 个点。损失不是容量限制:来自韵律控制语料库的 7,442 个剪辑的 微调 以 5 点关键字成本恢复了超过其语音前水平的情感。它也不是数据量:29,428 个挖掘的剪辑,其音频描述明确命名了情绪,在匹配的曝光度下,情绪移动了 -0.0007。差异是结构性的:对比目标仅在没有它就无法分离批内负数的情况下才对属性进行编码;受控语料库固定句子内容,因此韵律是唯一的分离信号,而挖掘的音频描述命名情感,但仍可按场景内容分离。对同一音频的干预证实了因果关系:提高音频描述相似度并不能恢复情感,但压缩音频描述的多样性使情感成为唯一的分离轴,可以在三个种子中恢复 8.9 个点,在非表演语料库上获得较小的相同符号增益,而关键字准确性则相反。控制对比音频嵌入编码内容的是语料库结构,而不是大小或音频描述词汇。