论文

用于文本转语音评估的神经网络

Neural networks for Text-to-Speech evaluation

模型评测评测方法与指标

摘要

确保文本转语音 (TTS) 系统大规模提供人类感知的质量是现代语音技术面临的核心挑战。平均意见得分 (MOS) 和并列比较 (SBS) 等人类主观评估协议仍然是事实上的金标准,但它们成本高昂、速度缓慢,并且对普遍存在的评估者偏差敏感。本研究通过制定和实施一套新颖的神经模型来解决这些障碍,这些模型旨在近似相对(SBS)和绝对(MOS)设置中的专家判断。对于相对评估,我们提出了 NeuralSBS,这是一种 HuBERT 支持的模型,准确率达到 73.7%(在 SOMOS 数据集上)。对于绝对评估,我们使用自定义序列长度批处理以及 WhisperBert 引入了对 MOSNet 的增强,WhisperBert 是一种多模态堆栈集成,通过弱学习器将 Whisper 音频特征和 BERT 文本嵌入结合起来。我们最好的 MOS 模型的均方根误差 (RMSE) 约为 0.40,显着优于人类评估者间 RMSE 基线 0.62。此外,我们的消融研究表明,通过交叉注意力天真地融合文本会降低性能,这凸显了基于集成的堆叠相对于直接潜在融合的有效性。我们还报告了基于 SpeechLM 的架构和零样本 LLM 评估器(Qwen2-Audio、Gemini 2.5 flash 预览)的负面结果,这强化了专用度量学习框架的必要性。