论文
基于 LLM 的 ASR 中 无需训练 幻觉缓解的似然约束声学重排序
Likelihood-Constrained Acoustic Reranking for Training-Free Hallucination Mitigation in LLM-Based ASR
摘要
基于 大语言模型 (LLM) 的自动语音识别 (ASR) 系统通过利用强大的语言先验和多语言功能,在传统语音数据上实现了强大的性能。然而,在具有挑战性的条件下,这些先验可能会覆盖声学证据,导致意外翻译、指令执行、重复或灾难性删除。我们提出了似然约束声学重排序(LCAR),这是一种 无需训练 解码方法,可以改善声学基础,同时保留基本模型的支持。在每个解码步骤中,LCAR 首先保留其基本模型似然性落在贪婪标记边缘内的标记,然后使用根据注意力池音频嵌入和现有 LM 头计算出的声学兼容性分数对它们进行重新排序。通过将声学干预限制为合理的、模型支持的替代方案,LCAR 不需要额外的训练、外部检测器、参考转录本或推理时的辅助模型。我们使用人工审核的 TTS 和开源语音挑战套件在四个基于 LLM 的 ASR 系统上评估 LCAR。在 $δ=0.60$ 时,LCAR 消除了 38.8--57.1% 的探测器识别的幻觉故障,同时在标准开源测试集上很大程度上维持了 WER/CER。