论文

口音稳健 ASR 的对比正则化

Contrastive Regularization for Accent-Robust ASR

模型训练监督微调与指令调优

摘要

基于自监督声学预训练和 CTC 微调 的 ASR 系统在母语语音方面实现了强大的性能,但对口音变异仍然敏感。我们研究监督对比学习(SupCon)作为 CTC 微调 的轻量级、口音不变的辅助目标。话语级对比损失可以规范编码器表示,无需架构修改或显式重音监督。 L2-ARCTIC 基准测试表明,多个预训练编码器的 WER 一致减少,在未见重音评估下相对减少高达 25 - 29%。使用转录本内余弦色散进行的分析表明,SupCon 在重音可变性下促进了更紧凑和稳定的表示几何结构。总体而言,SupCon 提供了一种有效且与模型无关的正则化策略,用于提高口音稳健性。