论文
MURMUR:长格式 ASR 的高效推理系统
MURMUR: An Efficient Inference System for Long-Form ASR
摘要
长格式自动语音识别 (ASR) 需要高精度和低延迟,但现有系统强制在两者之间进行权衡。基于块的管道在并行窗口中处理音频以实现低延迟,但会丢失跨块上下文,并且需要脆弱的启发式方法来在边界处对齐说话人和时间戳。长上下文 ASR 模型一次性解决所有问题,以获得更高的准确度,但速度要慢一个数量级。我们提出了 Murmur,这是一种通过在两个层面上运行来克服这种权衡的推理系统。在块间级别,我们重新审视现代长上下文 ASR 的基于块的管道,将块大小视为可调超参数,并表明中间块大小在准确性和延迟之间取得了良好的平衡。在块内级别,我们通过应用于输出和语音标记的滑动窗口 KV 缓存驱逐策略来利用注意力稀疏性。在 AMI-IHM 上,Murmur 与单通精度相当,同时将延迟减少了 4.2 倍,并且通过词元驱逐获得了进一步的收益,相对 tcpWER 降级低于 1%。 Murmur 的代码可在 https://github.com/uw-syfi/Murmur 获取。