论文

语音识别中编码器-解码器模型的上下文适应

In-Context Adaptation of Encoder-Decoder Models in Speech Recognition

上下文与知识上下文工程

摘要

上下文学习提供了一种有吸引力的方法,通过在推理时提供语音-文本对作为演示,使自动语音识别 (ASR) 模型适应新的说话者、口音和领域。最近的研究表明,一些基于 LLM 的语音模型在提供交错的语音文本演示时能够进行 ASR 上下文适应。在这项工作中,我们询问上下文适应是否是所有编码器-解码器模型的固有能力。我们研究了两种形式的演示,即整理演示和交错演示,涉及六个编码器-解码器模型,涵盖传统的基于交叉注意力和基于 LLM 的架构。我们发现所有测试的模型都能够开箱即用地执行上下文适应,在预言机实验中实现高达 30% 的相对改进,使用首次通过假设时实现高达 23% 的相对改进。通过对三个英语数据集的对照实验,我们表明词汇和说话人信息都有助于成功适应。虽然交错演示在某些情况下是有效的,但整理演示可以带来全面的一致适应。我们的结果表明,ASR 的上下文适应并不是特定架构、训练或演示方法所独有的。