论文

Typhoon ASR 流媒体:具有实时浅融合的可操纵低延迟泰语语音识别

Typhoon ASR Streaming: Steerable Low-Latency Thai Speech Recognition with Real-Time Shallow Fusion

模型推理解码与生成控制

摘要

开放泰语自动语音识别 (ASR) 主要由基于 Whisper 的离线模型主导,这些模型在转录之前读取整个话语,排除了实时字幕和语音代理等低延迟用途。我们提出了一个用于流式泰语 ASR 的可部署系统,让用户可以在解码时控制其词汇,而无需重新训练。一个广泛使用的开放式泰国模型,经过完整的上下文训练,当作为真正的流运行时会崩溃;我们使用缓存感知编码器恢复流媒体,方法是转换它或调整本机流媒体编码器,并添加一个浅层融合层,该层使用 GPU n-gram 语言模型和短语增强对流媒体解码器内的候选者重新排名。在两个泰国基准测试和两种模型大小中,流模型在全上下文模型失败的情况下仍然可用,在一秒的预测中将字符错误率降低了 4.3-4.5 倍,同时运行速度比实时更快。然后,解码时引导将关键字召回率从 16.6% 提升至 20.7%,且没有准确性成本且开销可以忽略不计;大部分收益来自于普通训练记录的 n 元语法,它解决了模型听到但拼写不一致的代码转换单词的书面形式,并通过短语增强增加了对罕见领域术语的有针对性的控制。