论文

PSP:印度语文本转语音的可解释的每维口音基准

PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

模型评测评测方法与指标

摘要

标准文本转语音 (TTS) 评估衡量清晰度(WER、CER)和整体自然度(MOS、UTMOS),但不量化口音。合成器可能在所有四个方面得分都很高,但在目标语言的音素特征上听起来却不是母语。对于印度语言,这些特征包括卷舌发音、送气、元音长度和泰米尔语卷舌近似音(字母 zha)。我们提出 PSP(音素替换配置文件),这是印度语 TTS 的可解释的、按语音维度的口音基准。 PSP 将口音分解为六个互补的维度:卷舌塌陷率 (RR)、送气保真度 (AF)、元音长度保真度 (LF)、泰米尔扎保真度 (ZF)、Frechet 音频距离 (FAD) 和韵律特征分歧 (PSD)。前四个是通过强制对齐加上 Wav2Vec2-XLS-R 第 9 层嵌入上的母语者质心声学探针来测量的;后两者是语料库级别的分布距离。在此 v1 中,我们对印地语、泰卢固语和泰米尔语试点集上的四个商业和开源系统(ElevenLabs v3、Cartesia Sonic-3、Sarvam Bulbul、Indic Parler-TTS)进行了基准测试,第五个系统(Praxy Voice)包含所有三种语言,以及泰卢固语的 R5->R6 案例研究。三个发现:(i) 卷舌塌陷单调增长,语音困难印地语 < 泰卢固语 < 泰米尔语 (~1%、~40%、~68%); (ii) PSP 排序与 WER 排序不同——商业 WER 领导者并不统一在卷舌或韵律保真度上领先; (iii) 没有一个系统在所有六个维度上都是帕累托最优的。我们发布了原生参考质心(每种语言 500 个剪辑)、FAD 的 1000 个剪辑嵌入、PSD 的 500 个剪辑韵律特征矩阵、每种语言 300 个话语黄金集、MIT 下的评分代码以及 CC-BY 下的质心。正式的 MOS 相关性被推迟到 v2; v1 报告五个内部一致性信号以及本地音频健全性检查。