论文
融合大语言模型知识以实现自动语音识别
Merging the Knowledge of LLMs for Automatic Speech Recognition
摘要
通过利用在纯文本数据上训练的语言模型 (LM),对基于语音-文本配对数据进行训练的自动语音识别 (ASR) 系统进行了改进。浅层融合和密度比等 LM 融合方法是在 ASR 解码过程中结合外部 LM 的成熟方法。然而,由于 LM 推理,它们会产生额外的计算成本,这对于最近较大的 LM 来说尤其成问题。在本研究中,我们建议通过模型合并来合并外部 LM。该方法将 LM 直接集成到基于 LLM 的 ASR 模型的参数中,无需额外的推理计算成本。我们通过 LoRA 参数的算术运算制定域扩展和传输。对在 CSJ 和 LibriSpeech 上训练的基于 LLM 的 ASR 的领域适应进行了实验评估。我们表明,我们的 LM 合并持续改进了目标域中的 ASR 性能,而不会降低推理速度或内存占用。