论文
超越编码器融合:基于 LLM 的 ASR 的多视图离散词元增强
Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR
摘要
离散语音标记在语音编码器和用于自动语音识别的大型语言模型之间提供了紧凑的接口,但单标记化系统仍然对所选编码器敏感。我们提出了多视图离散词元增强,这是一种简单的策略,通过从固定 SSL 编码器(例如 HuBERT、WavLM 和 MMS-300M)生成替代词元序列来增强每个训练话语。这些标记化被视为共享 LLM 解码器的补充训练视图,使其暴露于更多样化的离散语音表示,而不需要多编码器推理。在测试时,该模型可以使用单个编码器运行。在 LibriSpeech 上,该方法在独立训练的基线上持续改进了所有编码器,WavLM 在测试清洁上达到 3.30% 的 WER,在测试其他上达到 8.13%。预算匹配的控制表明,收益来自编码器多样性而不是数据量。 ROVER 相对于多视图假设进一步将 WER 提高到 3.03% 和 7.38%。