论文
使用自监督语音表示进行强制对齐评估的音素和单词级度量
Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation
摘要
强制对齐评估通常需要手动注释时间戳,限制了大规模和多语言分析。我们引入了两种基于自监督(SSL)语音表示的语料库级指标,用于无参考强制对齐评估:音素簇互信息(PCMI)和词声学一致性得分(WACS)。 PCMI 测量对齐的音素标签和由 SSL 语音表示得出的簇之间的一致性,而 WACS 使用单词表示序列之间的动态时间扭曲相似性来测量重复单词实现的一致性。使用随机和系统扰动,我们表明 PCMI 和 WACS 在对齐扰动下一致退化。我们进一步分析了 FLEURS 85 种语言的多个对齐系统的指标,对照 DoReCo 中 45 种语言的手动注释对齐进行验证,并在两种语音复杂的低资源语言上评估它们。这些指标有效地区分了高质量和低质量的对齐,并与基于时间戳的对齐质量度量密切相关。我们的结果表明,SSL 语音表示可以实现可扩展、无参考的强制对齐评估。这些指标以开源 Python 包的形式提供,网址为 https://github.com/mahesh-ak/forced-aligner-metrics。