论文
德语语音识别的语音信息标记化:跨领域研究
Phonologically Informed Tokenization for German Speech Recognition: A Cross-Domain Study
摘要
德语是一种形态丰富的语言,Knuth--Liang 连字算法可以很好地预测其音节结构。我们询问语音信息标记化是否可以作为端到端语音识别的竞争目标。我们比较了使用 CTC 微调的全语言 ASR wav2vec 2.0 主干上的三个分词器系列:预训练的多语言字符库存、基于正字法的数据驱动字节对编码 (BPE),以及来自 Pyphen 音节化和字素到音素转换的语音通知单元。通过 40 个微调,我们对三个跨越正交移位的德语测试集进行了评估:域内朗读语音、方言自发语音和标准德语自发语音。在域内,所有语音通知标记器都匹配 BPE 以及 WER 和 CER 上的多语言字符基线。在领域转移下,图片沿着词汇量大小而不是变化的语言轴进行分割:在小词汇量下,音节感知标记化改进了方言语音,其中语音表面形式有所不同,但 音节结构被保留,并在自发语音中保持领先,其中新词形违反了词汇闭合。音素级混淆分析进一步表明,所有分词器都犯了相同的规范功能词错误,这表明声学编码器(而不是分词器)主导了错误拓扑。我们的研究结果表明,分词器的选择可能取决于词汇预算以及部署时预期的分布变化,而不是减少到单一的通用最优值。