论文
挑战端侧流式ASR的极限:面向低延迟推理的紧凑高精度英语模型
Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference
摘要
在边缘设备上部署高质量自动语音识别(ASR)需要模型在完全依靠CPU、无GPU加速运行的条件下,联合优化准确率、延迟与内存占用。我们对最先进的ASR架构开展系统性实证研究,涵盖编码器-解码器、transducer和基于LLM的范式,并在批量、分块和流式三种推理模式下进行评估。通过对50多个配置的综合基准测试——涵盖OpenAI Whisper、NVIDIA Nemotron、Parakeet TDT、Canary、Conformer Transducer和Qwen3-ASR——我们确定NVIDIA的Nemotron Speech Streaming是资源受限硬件上英语实时流式识别的最强候选。随后,我们在ONNX Runtime中重新实现了完整的流式推理流水线,并对多种训练后量化策略——包括重要性加权k-quant、混合精度方案和最近取整(round-to-nearest)量化——结合图级算子融合进行了受控评估。这些优化将模型从2.47 GB压缩至最低0.67 GB,同时保持词错误率(WER)与全精度PyTorch基线的绝对差距在1%以内。我们推荐的配置int4 k-quant变体在八个标准基准上取得8.20%的平均流式WER,在CPU上以0.56秒算法延迟轻松快于实时运行,为端侧流式ASR确立了新的质量-效率Pareto点。