论文
对多语言 TTS 进行基于音系学的评估
Towards a Phonology-Informed Evaluation of Multilingual TTS
摘要
神经 TTS 系统在不同语言中听起来都很自然,但自然性并不能保证保留区分单词与其语法形式的声音对比。 MOS 等标准指标不会对此进行测试。我们提出了一个基于分类器的框架,以人类语音为基准,针对特定语言的语音模式审核 TTS 输出。使用 Meta 的 MMS TTS 测试阿萨姆语高级舌根 (ATR) 元音和谐性,结果表明,经过人类语音训练的分类器可以以最小的损失转换为合成语音。 忠实性 审计显示,尽管存在基本的 [+ATR] 规范(人类语音中不存在这种偏差),但 [+ATR] 中元音在 1/3 词元中实现为 [-ATR]。在单词级别,预测的 ATR 标签比转录标签更准确地对和声进行分类,这表明预期音系和生成音系之间存在差距。该框架提供了特定于任务的诊断,并推广到与可测量的声音线索的其他语音对比。