论文
使用 LLM 生成的未遂事件进行对比训练,实现鲁棒的代码切换语音识别
Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition
摘要
语码转换(CS),即单个话语中多种语言之间的交替,对于自动语音识别(ASR)来说仍然是一个挑战。为了解决这个问题,我们提出了一种兴趣点(POI)感知对比训练框架,可以提高 CS 关键区域的识别能力。我们首先采用文献中的 POI 检测方法来识别 CS 跨度,然后通过扰乱 ASR N 最佳输出中的 POI 并使用 大语言模型 扩展候选者来构建声学上合理的近乎未命中假设。通过声学、音素和文本限制的过滤,保留了困难但合理的否定。最后,我们使用 POI 加权交叉熵锚定目标以及多负对比排名损失,通过 LoRA 微调 Whisper-small。 CS-FLEURS (cmn-eng) 和 ViMedCSS (vie-eng) 上的实验表明,与标准 LoRA 微调 相比,一般错误率和 CS 感知错误率均持续降低 2% 以上。