论文
T-SANDHI:具有解耦混合注入的声调感知自适应网络,用于资源匮乏的台湾闽南语语音识别
T-SANDHI: Tone Sandhi-aware Adaptive Network with Decoupled Hybrid Injection for Low-resource Taiwanese Hokkien Speech Recognition
摘要
在台湾闽南语自动语音识别(ASR)中,先前的研究经常将连读变调视为主要挑战,假设模型无法处理隐含的语音变化。然而,我们对台湾闽南语的实验表明,语音基础模型实际上可以有效地处理变调变体,而真正的性能瓶颈源于这些变体和保留的引文声调之间的局部混淆。为了解决这个问题,我们建议 T-SANDHI 将表面声学与冻结 Whisper 主干之上的潜在词汇意图明确解耦。我们的轻量级混合注入模块使用由文本派生的伪标签驱动的词典引导的多任务学习结构,通过动态门控集成了独立引文和连读语音流。对 TAT-MOE 语料库和两个盲测试集的广泛评估表明,这种明确的解开有效地解决了色调映射混乱,优于具有严格参数效率的基线。