论文

WhisperPipe:用于实时自动语音识别的资源高效型流架构

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

AI 基础设施推理服务

摘要

实时自动语音识别 (ASR) 系统面临着转录准确性和计算效率之间的基本权衡,特别是在部署像 Whisper 这样的大规模 Transformer 模型时。现有的流方法要么通过积极的分块牺牲准确性,要么通过无限制的上下文积累产生过高的内存成本。我们推出了 WhisperPipe,这是一种新颖的流式架构,可实现有限的内存消耗,同时通过三项关键创新保持转录质量:混合语音活动检测 (VAD) 管道,将 Silero VAD 与基于能量的过滤相结合,将错误激活减少 34%;具有重叠上下文窗口的动态缓冲机制,可防止分段边界处的信息丢失;以及基于语音特征平衡延迟和准确性的自适应处理策略。对 2.5 小时的不同音频数据进行评估后,与基线 Whisper 实现相比,WhisperPipe 的端到端延迟中位数为 89 毫秒(第 90 个百分位:142 毫秒),同时消耗的峰值 GPU 内存减少了 48%,平均 GPU 利用率降低了 80.9%。系统在长时间会话中保持稳定的内存使用量,在 150 分钟的连续运行中保持零增长率。与相关工作的比较分析表明,WhisperPipe 实现了具有竞争力的准确性(WER 比离线 Whisper 低 2%),同时运行延迟比现有流媒体解决方案低 3-5 倍。该架构的模块化设计支持跨资源受限环境(从边缘设备到云基础设施)的部署。我们的结果表明,仔细的架构设计可以协调生产 ASR 系统中实时响应能力和模型复杂性的竞争需求。