论文

通过从未发生过的对话进行高效 ASR 训练

Efficient ASR Training with Conversations that Never Happened

模型训练合成数据

摘要

适用于资源较低的语言和利基领域的对话式 ASR 受到领域匹配的多说话者训练数据稀缺的限制。我们提出了一种增强管道,可以使用参与者元数据生成场景级对话,将说话者属性映射到 TTS 语音配置文件,并将合成话语组装成说话者感知的模拟对话。我们在单发电机、固定预算混合和扩展设置下对五个 LLM 系列进行了评估,每个系列均使用相同的 FastConformer-Large 训练方案。我们对匈牙利 BEA-Dialogue 基准语料库进行了全面评估,考虑到每个组件的资源,该方法本身适用于任何语言。结果表明,合成对话持续提高语音识别性能,但生成器的选择和数据组合会强烈影响增益。我们最大的训练配置仅使用 67 小时的真实对话和 636 小时的模拟数据,在评估基准上取得了比使用 2700 小时匈牙利语语音训练的零样本模型更好的性能。这些发现表明,LLM 生成的 TTS 合成会话数据是对真实语音会话语料库 模型训练 的实用补充。