论文
用冻结语音模型重评分实现免训练发音转写
Training-Free Pronunciation Transcription via Text-Constrained Acoustic Rescoring
摘要
准确高效的发音转录对于大规模准备文本到语音训练数据至关重要。现有方法具有不同的局限性:字形到发音(G2P)和语音到发音(S2P)方法各自仅捕获部分信息,仅使用文本或仅使用语音,而语音和文本到发音(ST2P)方法使用这两种方法,但需要昂贵的发音注释数据。为了解决这个问题,我们提出了一种免训练的 ST2P 管道,它在推理时集成了词汇和声学信息。词汇资源和 G2P 工具生成文本约束的候选者,从左到右的贪婪搜索使用来自冻结的预训练 S2P 模型的全序列负对数似然来选择最佳候选者。在三个日语语料库上,使用参考转写时,字符错误率(CER)从纯文本基线的 0.60—1.40% 降至 0.04—0.17%;使用 ASR 转写时,CER 为 0.64—1.58%。它优于所有基线,包括训练有素的 ST2P 模型和商业多模式大语言模型。我们的贪婪搜索方法比类似 CER 下的束搜索快 3--3.5$\times$,级联比直接解码快 2$\times$,确保了效率和准确性。在西班牙语、法语和初步英语实验方面,它也超过了四个开放式多模式大语言模型和最好的传统方法。
