论文

适用于任何 ASR 模型的基于梯度的语音到文本对齐:从 CTC 到语音 LLM

Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

应用与实践语音识别与转写

摘要

语音到文本对齐意味着找到音频中每个单词的时间边界。有些模型直接提供这种对齐方式,而另一些则不提供。连接主义时间分类 (CTC) 和转换器模型在构造上具有对齐,而基于注意力的编码器解码器 (AED) 和语音 大语言模型 (LLM) 则没有,并且它们的单词计时通常是从注意力权重中读取的。所有这些信号都存在于编码器帧网格上,这限制了它们的时间精度。我们研究了一种通用的基于梯度的对齐方式,适用于任何可微分的 ASR 模型。我们采用每个教师强制的标记对数概率相对于输入的梯度,将其减少到每帧显着性,并使用单个动态编程通道将结果矩阵解码为字边界。该方法不需要训练,不需要模型修改,也不需要对齐头,适用于包括语音 LLM 在内的所有模型系列,并且在输入网格上而不是在较粗的编码器网格上对齐。我们对来自四个家族的 16 个模型进行了评估,包括阅读(TIMIT)和自发(Buckeye)语音,每个模型都针对模型自身的本机或基于注意力的对齐。我们发现梯度为每个模型产生可用的对齐方式,它通常在某种程度上落后于强大的本机对齐器,但在本机对齐较弱的情况下更好,对于流模型而言,其主要缺点是每个词元一次向后传递的成本。