论文

语义足以预测语音平均意见分数吗?

Is Semantics Enough for Speech Mean Opinion Score Prediction?

模型评测模型能力评测

摘要

平均意见得分 (MOS) 是评估合成语音自然度的金标准。然而,当前的自动 MOS 预测器以自监督学习 (SSL) 模型为主,该模型优先考虑高级语义,这可能会损害其捕获关键声学细节的能力。在本文中,我们系统地研究了三种范式的表示:SSL、纯声学神经音频编解码器(NAC)以及将语义集成到基于重建的架构中的统一 NAC。对标准 BVCC 和多个域外 (OOD) 数据集的广泛基准测试表明,将语义理解与细粒度声学建模相结合的功能可在语音质量评估中实现更高的性能上限。最终,我们的研究结果强调,仅靠语义是不够的;还需要依赖语义。对语义内容和声音保真度的双重关注对于稳健的 MOS 预测至关重要。