论文

预算语气:大规模多语言文本转语音中词汇语气的无参考指标

Tone on a Budget: A Reference-Free Metric for Lexical Tone in Massively Multilingual Text-to-Speech

模型评测评测方法与指标

摘要

在约鲁巴语中,单独的音高将 \d{o}k\d{o}(丈夫,中)、\d{o}k\d{ò}(车辆,低)和 \d{o}k\d{ó}(锄头,高)分开——变音符号是音调标记。然而,文本转语音 (TTS) 的标准自动化指标字符错误率 (CER) 实际上是根据 ASR 输出计算得出的,而这些分数会下降:合成器可以在 CER 方面取得优异成绩,但仍然会说“丈夫的车辆”。我们引入了 DunDun——以 dùndún 命名,这是一种只通过音高说话的约鲁巴语鼓——一种自动化的、无参考的词汇音调度量,不需要音调标记的语料库。金色的高/中/低序列是从输入文本的变音符号中读取的(在 TTS 中,文本通过构造而存在,因此不需要参考记录);预测来自音频的音高轨迹。我们验证三种方式。使用 PSOLA 再合成压平音高会导致 DunDun 崩溃,而 CER 不会移动。反转 300 个本地录音的答案键中的高位和低位会将两级读数驱动到 0.14,对称地低于其 0.35 机会水平——这是对评分路径的一致性检查,而不是独立证据。三位母语听众在超过 67 次盲目 A/B 试验中,在 89.6% 的时间内选择了音调正确的剪辑(95% CI 80.0-94.8;p < 1e-4);在这个样本量下,DunDun 是否逐次跟踪这些判断还没有解决。应用于大规模多语言零样本 TTS 模型时,DunDun 展示了 CER 无法做到的功能:在任何约鲁巴语微调之前,约鲁巴语音调位于本地锚点附近(五个解码种子为 0.567 +/- 0.02,对比 0.596;机会为 0.33),尽管模型自己的论文报告的 CER 为 21.4%;几个小时的干净音频会使 CER 减半(5 小时内为 5.6% 至 2.7%,15 小时内为 1.7%),而音调在一小时内饱和。对于非声调斯瓦希里语,CER 已经取得了成果:语言所需的度量取决于语言。我们发布了指标和完整的验证协议。