论文
LaSR:通过潜在推理进行上下文感知语音识别
LaSR: Context-Aware Speech Recognition via Latent Reasoning
摘要
专业领域的语音识别需要利用上下文或主题信息来提高对特定领域实体的识别。 Speech 大语言模型 (Speech LLM) 具有相当先进的语音理解和推理功能,无需预定义偏差列表即可进行上下文感知语音识别。在本文中,我们提出了 LaSR(潜在语音推理),这是一种新颖的训练范式,具有利用潜在推理过程的上下文感知推理轨迹。 LaSR 不是生成显式的中间标记,而是围绕目标单词的声学特征区域调整思想链 (CoT) 监督,并引入上下文信息基础和转录转换的潜在推理周期。此外,为了有效地对上下文感知语音识别进行基准测试,我们提出了达尔文科学口语,这是一个专注于学术术语的大型语料库。 Fun-Audio-Chat 上的初步实验表明,LaSR 在不引入额外延迟的情况下显着提高了术语识别能力,并且始终优于标准监督 微调 基线。我们的研究结果强调了潜在推理在构建高效、上下文感知语音助手方面的潜力。