论文

文本到语音语音重建的评估框架

An Evaluation Framework for Text-to-Speech Voice Reconstruction

模型评测评测方法与指标

摘要

使用文本转语音 (TTS) 的语音重建为言语障碍患者提供了一种沟通方法,旨在保留说话者身份的同时提高清晰度。以前的工作通常依靠平均意见得分(MOS)来评估自然度和说话者相似度,但这灵敏度和可靠性有限。我们提出了一个包含主观和客观组成部分的评估框架。主观上,我们使用最佳最差缩放 (BWS) 和情景框架来评估感知清晰度和说话者身份。客观地,我们证明标准测量无法预测高度难以理解的说话者的重建成功,因此我们引入了一种新颖的双参考分布测量来评估可懂度和说话者身份之间的权衡。通过评估 193 个说话人的 17 个零样本 TTS 系统的输出,我们表明我们的框架为评估语音重建提供了可靠且与任务一致的方法。