论文

倾听潜在的声音:通过隐藏状态交互在大型音频语言模型中进行自校正语音识别

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

模型推理推理验证与自校正

摘要

最近的自动语音识别 (ASR) 系统越来越多地集成 大语言模型 (LLM) 以利用其语义知识,无论是在外部通过 logits 融合还是在内部通过热初始化。然而,如何有效地将这两种策略结合起来仍有待探索。在这项工作中,我们通过利用自己的预适应基础 LLM 来完善基于热初始化的 LLM 的 ASR 模型,重点关注保留基础 LLM 的 LoRA 适应设置。为了实现这一目标,我们提出了混合搜索,这是一种由两个观察结果驱动的有针对性的校正策略。首先,表征基于 LLM 的 ASR 隐藏状态和基本 LLM 隐藏状态之间关系的交互特征提供了有关词元语义依赖程度的信息信号。其次,选择性地精炼具有高度语义依赖性的目标标记,可以提高 ASR 性能,远远超过简单的全局 LLM 校正方法(包括重新评分和后期融合)。我们的分析表明,即使在通过热初始化进行语义知识转移之后,基于 LLM 的 ASR 模型仍然可以利用其基础 LLM 来进一步提高推理时间性能。