论文

基于 LLM 的语音识别的音素优先预测

Phoneme-First Prediction for LLM-Based Speech Recognition

模型训练监督微调与指令调优

摘要

最近的研究探索了将 大语言模型 (LLM) 与语音编码器集成,以创建能够进行情境化语音识别的语音增强 LLM。主要挑战在于将 LLM 的语义嵌入与语音编码器的声学表示对齐。我们提出了一种新颖的方法,教 LLM 在生成最终转录之前首先根据语音特征预测音素。通过将音素预测步骤直接集成到 LLM 中,该模型开发了细粒度的发音知识,减少了声音混乱并提高了转录准确性和可解释性。我们的方法既便宜又简单,因为音素目标可以从现有的转录本中自动导出。通过全面的实验,我们表明中间音素预测可以改善语音识别,特别是在资源匮乏的环境中,并产生在声学上更忠实于语音的输出。