论文
用语义锚定语音:用于低资源语言自动语音识别的多模态适配器机制
Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages
摘要
低资源 ASR 仍然很困难,因为稀缺的转录本为目标端生成提供了有限的监督证据。为了解决这一差距,我们提出了 SAMA-ASR,这是一种轻量级适配器机制,可以使用来自辅助翻译的语义锚和来自语音的声学锚来增强解码器;原则上,该机制可以应用于类似的编码器-解码器多任务语音模型。通过跨模态适应,SAMA-ASR 在翻译衍生的语义嵌入和语音嵌入上设置解码器状态,在标记预测之前将话语级含义与基于语音的证据相结合。在评估时,这些语义锚可以由上游语音到文本翻译器自动生成,而不是作为预言机翻译提供。对两个涵盖资源匮乏的华语变体台湾闽南语和客家语的两个 30 小时数据集进行的实验表明,SAMA-ASR 比声学、基于先前提示和仅语义翻译引导的基线有所改进,并且在实际的自动语义锚设置中仍然有效;译者能力分析表明,紧凑的 ST 模型可以产生有用的语义锚。