论文

您只需要文字吗?文本作为语音的通用信息瓶颈 LLM

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

模型架构新型架构

摘要

大语言模型 (LLM) 为语音理解提供了强大的推理支柱,但将连续声信号集成到冻结的 LLM 中仍然具有挑战性。现有的语音到 LLM 接口通常在两个极端下运行:要么强制执行近离散标记对齐,这有利于转录,但会丢失副语言信息;要么学习不受约束的连续表示,这可能会偏离 LLM 的输入空间并降低自回归解码性能。在这项工作中,我们提出了凸门(C-Gate),这是一种语音到 LLM 的桥,它通过架构凸包约束将所有语音表示限制在 LLM 的输入嵌入流形内。具体来说,每个帧都表示为词元嵌入的凸组合,确保与预训练的 LLM 的兼容性,同时保持连续的表达能力。在自动语音识别 (ASR) 和情感识别方面,C-Gate 实现了强大的联合性能,将 LibriSpeech WER 相对提高高达 48.7%,同时匹配或超过单任务情感准确度。除了性能之外,我们的分析揭示了一个关键的见解:信息不是由离散的词元身份承载的,而是由嵌入空间中的时间分辨轨迹承载的。因果干预证实,轨迹结构和与预训练嵌入流形的对齐对于性能至关重要。这些结果表明,几何形状(而不是标记离散性)是语音到 LLM 接口的基本设计因素,并为研究冻结 LLM 中的多模态集成提供了受控机制。我们发布了检查点、每个样本的输出、机制转储和复制干预套件。