论文

DirectSpeech2LLM:缓解语音语言模型的提示过拟合

DirectSpeech2LLM: A Simple End-to-End Framework to Mitigate Prompt Overfitting in Speech-LLMs

模型架构混合架构

摘要

Speech-LLM 经常表现出快速过度拟合,仅在自动语音识别 (ASR) 指令上训练的模型无法泛化到语音翻译等新指令,并且继续主要表现为 ASR 系统。我们提出了 DirectSpeech2LLM,一个简单的端到端框架,它在以语音为条件时保留了 LLM 在看不见的任务上的指令跟踪能力。它计算冻结 LLM 嵌入矩阵上基于距离的 CTC 损失,并使用贪婪 CTC 标签分别导出几何和时间对齐的语音嵌入,作为 LLM 的输入。仅使用 960 小时的 LibriSpeech ASR 数据进行训练,DirectSpeech2LLM 在 ASR(已见任务)上优于级联系统,并将零样本推广到语音翻译和情感识别(两个未见任务),与这两个新指令的级联系统上限紧密匹配,尽管在训练期间两者都没有看到。我们还发现几何对齐强度的作用比之前假设的要小,因为我们修改后的 CTC 损失被证明可以提供足够的隐式几何基础,而不需要显式回归损失。两个 LLM 系列的结果是一致的,并且可以随着更多的训练数据和模型容量而扩展。

DirectSpeech2LLM:缓解语音语言模型的提示过拟合:论文原图
图 1:DirectSpeech2LLM 概述。给定输入语音信号,SFM 生成帧表示 $s_{t}\in\mathbb{R}^{d}$,其中 $d$ 与 LLM 输入嵌入 $Q$ 的维度匹配。 Logits 计算为负平方距离 ($Z_{t,v}$),后跟 log-softmax 并应用 CTC 损失 ($\mathcal{L}_{\text{ctc}}$)。接下来,生成的贪婪 CTC 预测标签将用于通过均值池化对 SFM 输出嵌入进行下采样。 LLM 被输入来自 SFM 的更新序列嵌入,并使用交叉熵损失 ($\mathcal{L}_{\text{llm}}$) 进行训练。读者应记住,LLM-IES 仅用作 SFM-OES 的几何锚点,而不会被 LLM 输入嵌入替换或离散化。为清楚起见,图中未显示承诺损失。