论文

跨域流电喉语音编码的多教师蒸馏

Multi-Teacher Distillation for Cross-Domain Streaming Electrolaryngeal Speech Encoding

摘要

自监督学习 (SSL) 改进了语音表示,但在电喉 (EL) 语音等病理领域中的性能会下降,而且 SSL 模型的计算足迹限制了它们在实时设备上部署中的适用性。我们提出了一个多教师知识蒸馏框架来训练一个轻量级的流内容编码器,该编码器可以泛化健康(HE)和 EL 语音。逐步提炼出两个教师:一个冻结 SSL 模型,提供来自 HE 语音的离散语音簇目标;以及一个 EL 微调语音识别模型,提供连续的瓶颈特征目标。通过下游语音识别进行评估,我们的方法将 EL 单词错误率降低至 21.2%,而最强的零样本 SSL 基线的错误率为 39.3%。在因果卷积、Transformer、Conformer 和基于 Mamba 的学生架构中,Mel-Conformer 实现了 EL 精度和计算效率的最佳组合。最终编码器包含 21.9,M 个参数,并在单 CPU 内核上的 ONNX Runtime 下以 0.30 的实时因子运行。