论文
MSR-HuBERT:用于适应多种采样率的自监督 预训练
MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates
摘要
自监督学习 (SSL) 具有先进的语音处理能力。然而,现有的语音 SSL 方法通常采用单一采样率,并且由于时间分辨率不匹配而难以处理混合速率数据。为了解决这个限制,我们提出了 MSRHuBERT,一种多采样率自适应 预训练 方法。在 HuBERT 的基础上,我们将其单速率下采样 CNN 替换为多采样率自适应下采样 CNN,该 CNN 将不同采样率的原始波形映射到共享时间分辨率,而无需重新采样。此设计可实现统一的混合速率 预训练 和 微调。在跨越 16 至 48 kHz 的实验中,MSRHuBERT 在语音识别和全频带语音重建方面优于 HuBERT,在对低频语义结构进行建模的同时保留了高频细节。此外,MSRHuBERT 保留了 HuBERT 的掩模预测目标和 Transformer 编码器,因此为 HuBERT 开发的现有分析和改进可以直接应用。