论文

扩展匈牙利语 ASR 会话:BEA-Dialogue+ 语料库

Scaling Conversational Hungarian ASR: The BEA-Dialogue+ Corpus

模型评测基准与评测资源

摘要

匈牙利语的对话式自动语音识别受到公开可用的对话式训练数据数量有限的限制。 BEA-Dialogue 语料库满足了这一需求,但其严格的说话人不相交的训练/开发/评估分割将可用材料减少到只有 85 小时。在本文中,我们介绍了 BEA-Dialogue+,这是语料库的扩展版本,它放宽了实验者和对话伙伴的分割标准,同时保持主要说话者的完全分离。这导致了 200 小时的自然对话转录,并能够对额外训练数据和不同分割的说话者重叠之间的权衡进行受控研究。我们在两个语料库版本上评估了几种基于 Whisper 和 FastConformer 的模型,包括用于对话转录的基于序列化输出训练 (SOT) 的 微调。我们的结果表明,对于没有 微调 的模型来说,更大的语料库更具挑战性,而基于 SOT 的适应在 WER、CER、cpWER 和 cpCER 方面产生了一致的改进。总体而言,BEA-Dialogue+ 为匈牙利对话 ASR 提供​​了一个更大但仍然要求更高的基准,以及用于训练和评估对话转录系统的实用资源。