论文

使用语音质量评估模型对现代土耳其语文本转语音进行全面客观评估

A Comprehensive Objective Evaluation of Modern Text-to-Speech for Turkish Using Speech Quality Assessment Models

模型评测评测方法与指标

摘要

现代文本转语音 (TTS) 系统可以从简短的参考剪辑中克隆目标说话者,或者对目标声音进行微调,但它们在形态丰富、资源匮乏的语言(例如土耳其语)上的行为仍然没有得到充分表征。我们提出了四个当代系统(Chatterbox、CosyVoice、OmniVoice 和 VoxCPM2)的系统基准,这些系统通过微调和零样本配置进行评估,与传统的 VITS 基准进行对比并锚定于自然黄金语音。每个配置都使用 18 个互补的客观指标进行评分,涵盖学习的自然度预测器(UTMOS v2、DNSMOS-Pro、SCOREQ、WhisQA、AudioBox-PQ、NatScore、SpeechLMScore)、清晰度和信号质量估计器(SQUIM PESQ/SI-SDR/STOI、Brouhaha)、说话者相似度、分布保真度 (TTSDS) 和低级声学描述符。我们进一步分析质量如何随话语长度变化,并通过说话者身份和分块话语的自然度漂移来量化长形式时间一致性。我们发布了评估代码以支持可重复的 TTS 评估。

使用语音质量评估模型对现代土耳其语文本转语音进行全面客观评估的原论文方法或结果图
图 1:雷达指标比较,标准化为常见的 $[0,100]\%$ 比例,CosyVoice 由其规范的原始文本配置表示。图例注释报告每个系统的标题数量