论文

在基于 LLM 的 ASR 中,通过语音文本对齐来细化伪音频提示,以实现纯文本域适应

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

模型训练监督微调与指令调优

摘要

基于LLM的自动语音识别模型通过连接音频编码器和LLM展现出强大的性能。然而,配对语音和转录的数据稀缺往往会阻碍它们对新领域的适应,因此纯文本领域的适应至关重要。现有方法通常依赖于单独的 微调 和 LLM 或采用伪音频提示。前者忽略了基本的声学背景,而后者要么在数据稀缺的情况下受到有限的可扩展性的影响,要么通过仅利用文本特征而忽略音频模态而产生缺乏表达力的提示。为了解决这个问题,我们提出了一个增强的框架,可以显式地模拟语音文本对齐。我们的方法有效地生成高度表现力的伪音频提示,弥合模态差距,从而实现有效的目标域适应。实验表明,我们的方法优于现有的纯文本方法,提高了总体错误率和词汇表外覆盖率。