论文
用于基于 LLM 的自动语音识别的语音编码器融合
Speech Encoder Fusion for LLM-based Automatic Speech Recognition
摘要
语音感知 大语言模型 (LLM) 可以通过预先训练的声学编码器合并语音,将语音特征投影到 LLM 嵌入空间中。虽然语音编码器的选择严重影响性能,但不同的编码器通常表现出互补的优势,从而促进它们的组合。在这项工作中,我们研究融合多个预训练的语音编码器是否可以增强自动语音识别(ASR)的语音感知 LLM。我们探索了超越简单特征串联的几种融合策略,包括学习组合和基于 Transformer 的融合架构,并在单语言和多语言 ASR 设置以及分类语音识别中对其进行评估。我们的结果表明,仔细融合多个并行语音编码器可以在计算开销有限的情况下提高所有场景中的下游性能。