论文
NIM4-ASR:迈向高效、稳健、可定制的基于 LLM 的实时 ASR
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
摘要
将大语言模型(LLM)集成到自动语音识别(ASR)中已成为近年来的主流范例。尽管现有的基于 LLM 的 ASR 模型在公共基准上表现出了令人印象深刻的性能,但它们的训练仍然主要是数据驱动的,导致关键的实际挑战没有得到充分解决——特别是在资源受限的部署和声学挑战条件下的幻觉中向下可扩展性有限。为了解决这些问题,我们提出了 NIM4-ASR,这是一种面向生产、基于 LLM 的 ASR 框架,针对效率和稳健性进行了优化。基于编码器和 LLM 之间功能角色的原则性描述,我们重新设计了多阶段训练范例,以使每个模块与其预期的能力边界保持一致。具体来说,我们重新制定了 预训练 架构和目标,以缩小模态差距并提高参数效率;引入迭代异步 SFT 阶段以保持声音保真度并限制表示漂移;并设计了一个专门的ASR强化学习阶段,以进一步提高识别质量和鲁棒性。我们还整合了一套面向生产的优化,包括噪声和安静条件下的鲁棒性、实时流推理以及通过检索增强生成(RAG)进行的热词定制。实验表明,NIM4-ASR 仅用 2.3B 参数就在多个公共基准测试中实现了最先进的性能,同时在内部基准测试中大幅优于更大规模的竞争对手,尤其是在实体密集的现实场景中。 NIM4-ASR进一步支持通过RAG进行百万级热词定制,检索延迟达到亚毫秒级,从而能够高效适应新兴实体和个性化用户需求。