论文
贸易:用于语音的传感器增强解码器 LLM
TRADE: Transducer-Augmented Decoder for Speech LLM
摘要
语音 大语言模型 (Speech LLM) 缺乏流式推理的原则机制:它们的标签同步生成没有声学帧对齐,使得实时解码和话语结束检测变得困难。我们提出 TRADE TRansducer 增强解码器,它通过共享音频编码器的传感器分支增强多模态 LLM,并直接使用 LLM 的隐藏状态作为预测网络 - 将帧同步声学对齐与 LLM 的语言推理耦合。三种设计选择使系统具有准确、可流化和长格式的能力:(1)紧密耦合的双词汇表——源自 LLM 词汇表的紧凑传感器词汇表,可实现零成本分数融合; (2)具有梯度停止的块同步流训练,消除了离线等效内存成本下的训练推理不匹配; (3)本地化解码器音频注意(LDAA),一种因果滑动窗口,它独立于话语长度来限制 KV 缓存内存。单个 TRADE 检查点支持跨连续范围的延迟操作点的离线和流式解码。 TRADE 在 Open ASR 排行榜上的平均 WER 达到 6.71%,而相同检查点的 960ms 块大小的流识别达到 8.40%。在长篇语音上,在没有外部分段的情况下,它在 TED-LIUM 上获得了 3.64% 的 WER,在 Earnings-22 上获得了 10.88% 的 WER。 TRADE 提供句子结束标点符号时间戳,与声学语音活动检测 (VAD) 结合使用时,与单独使用声学 VAD 相比,可将话语结束检测提高 +0.03 F_1。