论文
LLM 可以读取频谱图:无编码器的语音语言建模
LLM can Read Spectrogram: Encoder-free Speech-Language Modeling
摘要
最近的语音感知 大语言模型 (Speech-LLM) 依靠预先训练的语音编码器将音频转换为 LLM 可使用的语义/声学丰富表示。相反,在这项工作中,我们探索:LLM 能否学会在没有专用语音编码器的情况下直接读取梅尔频谱图?我们提出了 Mel-LLM,这是一种无编码器的 Speech-LLM,它通过线性投影将经过轻微预处理的梅尔频谱图块直接馈送到 LLM 中,允许 LLM 纯粹通过其自身的参数来学习语音文本对齐。我们专注于语音理解任务,包括自动语音识别(ASR)、口语 QA 和音频理解。对于 ASR,我们对 OpenASR Leaderboard 公共集和生产级扩展实验进行了评估,证明无编码器解决方案与编码器初始化的解决方案相比,实现了具有竞争力的性能,且性能下降有限。我们发现,当数据有限时,从多模式检查点 (Phi-4-MM) 进行初始化对于保持性能至关重要。我们还提出了消融研究,表明哪些 LLM 层与语音适应最相关。除了 ASR 之外,我们还将 Mel-LLM 扩展到一般语音/音频理解任务,揭示了声学语义权衡:直接将 LLM 暴露于 Mel 谱图输入可以改善副语言和非 ASR 声学任务,而知识密集型口语 QA 仍然比编码器锚定系统更具挑战性。我们还添加了带有下一个词元 VAE 解码器的文本转语音 (TTS) 概念验证,表明直接 Mel 生成是可能的,但仍然落后于更强的潜在扩散生成。