论文
重新思考语音-LLM ASR 集成:通过交织进行有效的联合语音文本训练
Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving
摘要
Speech-LLM 集成通过利用广泛的文本预训练显示出了可喜的结果,但其对自动语音识别 (ASR) 的具体好处仍不清楚。我们观察到,随着监督 ASR 训练数据的增加,LLM 先验的贡献变得不那么明显,并且简单的语音文本联合训练未充分利用文本知识。因此,我们提出联合语音文本交错预训练(JSTIP),这是一种面向 ASR 的预训练策略,可在接受连续输入的语音 LLM 架构的对齐对内构建单词级和段级交错语音文本序列。对 38k 小时的 ASR 数据进行的实验表明,与仅 ASR 和联合语音文本训练基线相比,实体准确性得到了一致的提高。与合成语音文本对相比,JSTIP 使用域转录文本实现了同等的实体识别性能,从而简化了域适应。受益于文本预训练和领域文本数据,JSTIP 在医疗实体识别方面与开源 ASR 和 Speech-LLM 系统具有竞争力。零样本语音问答行为进一步表明,交错减少了语音文本模态差距并保留了 LLM 生成先验,这可能是 ASR 任务上实体改进的原因。