论文
PTC-Bias:语音大语言模型中偏差检索和解码后纠正的音素级时间竞争
PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs
摘要
上下文偏差可以改善语音大型语言模型 (SpeechLLM) 中的稀有词识别,但有效利用大型偏差列表仍然具有挑战性。我们提出了 PTC-Bias,一个基于音素级时间竞争的两阶段框架。在预填充阶段,PTC Retrieval 执行帧同步音素解码和候选发音之间的时间竞争,生成紧凑的偏差词候选列表和相应的语音间隔。 SpeechLLM 解码后,PTC Correction 在检索到的候选者和这些间隔内不匹配的转录本跨度之间进行第二次本地竞争。选择性校正可减少近同音字和分词错误,同时保留正确的转录。两个阶段共享相同的音素后部,并且不需要额外的 SpeechLLM 前向传递。 LibriSpeech 上的实验显示,两个 SpeechLLM 和最多 2000 个单词的偏差列表的增益一致。使用 Prompt-SLAM-ASR-7B 和 2000 个偏差字,在 test-clean/test-other 上,PTC-Bias 相对于 CTC-Filter 将 B-WER 降低了 23.4%/23.9%,同时保持 U-WER 几乎不变。