论文
用于语音识别的缓存 LLM 概率检索
Cached LLM Probability Retrieval for Speech Recognition
摘要
大语言模型 (LLM) 通过提供语言先验来增强自动语音识别 (ASR);然而,他们的直接重新评分成本高昂,因为它需要评估每个 N 最佳假设。本文介绍了“缓存的 LLM 概率检索”,其中涉及离线查询本地教师 LLM 以获得 ASR 相关上下文目标对的下一个标记概率。然后,在识别过程中通过缓存查找、退避策略和针对重大遗漏的可选评分来利用这些概率。该方法是 无需训练,可以与现有识别器集成,无需修改声学模型。对各种 ASR 模型的评估表明,缓存检索在 39 个设置中的 28 个设置中优于 1-pass ASR,并实现了较低的非预言错误。上下文长度分析表明,效益在上下文长度为 8 时达到峰值,这表明缓存概率检索是一种有效且轻量级的 ASR 适应方法,与生成错误纠正 (GER) 或 知识蒸馏 (KD) 所需的繁重训练形成鲜明对比。