论文
利用 WavLM 和自然非校准语音录音中的数据增强推进基于说话者的发声力度分类
Advancing Speaker-Based Vocal Effort Classification with WavLM and Data Augmentation in Naturalistic Non-Calibrated Speech Recordings
摘要
声音力度范围的变化(例如耳语、轻声、中性、响亮、喊叫)会改变制作和语音声学,降低清晰度并限制任何后续语音技术的稳健性。分类具有挑战性,因为工作是连续的,相邻类别很容易混淆,并且标记数据仍然稀缺。之前使用 wav2vec2、HuBERT 和 AST 的 SSL 方法提高了 AVID 语料库的性能,但仍然存在边界错误。在这项研究中,我们首次在声音效果分类中引入 WavLM,并将其与 wav2vec2 和 HuBERT 进行基准测试。为了解决数据稀缺问题,我们对增强策略进行了系统研究,包括 RIR 卷积、加性噪声、时间掩蔽、速度扰动、带限、MixUp 和 CutMix。增强持续改善 WavLM,绝对增益范围为 +0.6% 至 +1.8%。我们进一步提出高斯邻居软标签,它通过对发声努力连续体进行建模来进一步减少近边界混乱。我们最好的系统 WavLM-BASE 具有逐步解冻、增强和高斯邻域软标签,达到 78.2% 的平均准确率,在 AVID 上建立了新的最先进水平。