论文
教大语言模型听谁说了什么:无编码器语音大语言模型的元数据监督预训练
Teaching LLMs to Hear Who Spoke What: Metadata-Supervised Pretraining for Encoder-Free Speech-LLMs
摘要
基于编码器的语音大语言模型 (Speech-LLM) 通常采用预训练的语音编码器,该编码器优先考虑语言内容,但可能会丢弃对于说话者辨别和副语言理解至关重要的细粒度声学线索。无编码器的语音 LLM 通过轻量级嵌入层将 Mel 谱图特征直接映射到 LLM 输入空间,使 LLM 能够从低级声学特征中学习。然而,无编码器语音 LLM 的系统预训练策略仍未得到充分探索,限制了它们弥补大规模预训练语音编码器缺失的能力。我们提出元数据监督预训练(MSP),它利用说话者身份和情感等语音属性来开发说话者辨别和副语言能力。我们进一步引入说话人感知话语合成(SAUC)来加强说话人辨别能力,并应用随机跨度掩蔽来规范预训练。我们主要评估多说话人对话中联合 ASR 和说话人分类的方法,并辅以副语言语音理解任务的实验。在匹配的训练数据条件下,我们的无编码器模型优于随机初始化的基于编码器的模型。由于元数据注释数据有限,它与使用在更大的语料库上预训练的语音编码器的模型具有竞争力,在多种设置中优于它们。这些结果证明了无编码器架构在构建获取多种语音功能的本地多模态 LLM 方面的潜力。