论文
ProxyMOS:通过多教师蒸馏和自适应路由进行无标签语音质量评估
ProxyMOS: Label-Free Speech Quality Assessment by Multi-Teacher Distillation with Adaptive Routing
摘要
人类平均意见得分 (MOS) 的收集成本很高,而且非侵入式 MOS 预测器在其训练领域之外会急剧退化。 ProxyMOS 将公共 MOS 预测器池转变为一个更强大的模型,无需新的人工标签。八个预测因子以人类评级为基准;信息最丰富的五个进入统一、相关加权、误差加权、MSE 优化和自适应每话语路由下的子集搜索;最佳路由的四模型集成标记了 807k 个未标记的话语,用于训练 wav2vec 2.0 学生。在紧急情况下,学生将 Spearman $ρ=0.802$ 与 $0.773$ 争夺最佳老师。在 mos260(一种新的俄罗斯 TTS 基准,包含 38 个合成条件下的 4,600 个话语)上,它达到了 $ρ=0.636$,每个话语相对于 $0.613$,每个条件达到 $0.95$,在一次前向传递中匹配其自己的路由集成。自适应路由是添加弱预测器时不会降级的唯一规则。模型、ONNX 出口和 mos260 发布。大约有950个字符; arXiv 的限制是 1,920。我保留了 $ρ$ 因为 arXiv 将其呈现在摘要页面上。如果您不想使用数学,请将 $ρ=0.802$ 替换为 rho = 0.802,并对其他 $...$ 值执行相同的操作。