论文

以音素引导初始化LLM语音识别模型

Phoneme-Guided Initialization for LLM-based Speech Recognition

模型训练模型推理预训练监督微调与指令调优解码与生成控制

摘要

当有足够的语音-文本配对数据可用时,语音大语言模型(语音 LLM)在自动语音识别(ASR)上表现良好,但在资源不足的情况下其性能会下降。在这种情况下,执行语音到音素 (S2P) 转换,然后执行音素到字素 (P2G) 转换的级联管道已被证明优于端到端语音 LLM,这表明当配对数据稀缺时,音素介导的处理是有益的。我们提出了 \textit{音素引导初始化},这是一种在端到端框架内使用这种见解的简单方法:我们在 S2P 上预训练音频编码器,在 P2G 任务上预训练 LLM,然后将它们连接起来,并在目标 ASR 任务上对完整模型进行端到端微调。对日语 (CSJ)、中文 (AISHELL-1) 和 Common Voice 25.0 中的两种低资源语言(塔塔尔语和乌尔都语)的实验表明,我们的方法匹配或优于级联 S2P-P2G 基线和无需 P2G 初始化的端到端模型。

以音素引导初始化LLM语音识别模型:论文原图
图 1:基于 LLM 的连续 ASR 概述。音频编码器提取语音表示,并通过投影仪将其映射到 LLM 的嵌入空间。LLM根据投影音频和文本提示生成转录。 𝐇\mathbf{H} 是编码器输出,𝐙\mathbf{Z} 是投影仪输出(馈送到 LLM 的音频嵌入)。