论文
CLAR:基于检索增强语音 LLM 的上下文 ASR 的 CIF 本地化对齐
CLAR: CIF-Localized Alignment for Retrieval-Augmented Speech LLM-Based Contextual ASR
摘要
由于强大的内部语言模型先验,基于语音 LLM 的 ASR 通常难以处理命名实体和长尾词。检索增强偏差可以提供帮助,但其有效性取决于弱监督下完整语音中的准确热词定位。我们提出了 CLAR,一种双编码器语音文本 检索器,它使用连续集成和激发 (CIF) 来学习没有时间戳的单调 词元级 对齐。通过长度感知的局部匹配,CLAR 锚定短实体声音线索并减少表示稀释和注意力漂移。 检索器 采用多粒度目标进行训练,该目标结合了全局和局部分段级对比损失以及 CIF 数量约束。在推理时,注入排名靠前的热词作为语音 LLM 的上下文提示,从而在不进行浅层融合的情况下提高识别能力。实验表明,相对于强上下文 ASR 基线,CLAR 显着改进了热词检索并减少了 CER 和 B-WER。