论文
在语音基础模型表示上使用距离度量进行客观清晰度预测
Objective Intelligibility Prediction Using Distance Metrics on Speech Foundation Model Representations
摘要
事实证明,预训练语音基础模型的高维表示有利于客观语音质量和清晰度预测。虽然现有的神经清晰度预测工作通常利用这种表示进行特定于任务的微调,但在这项工作中,我们在没有任何进一步训练的情况下评估了这种表示对于清晰度预测的有用性。我们对多个语音基础模型进行分层分析,将各种嵌入距离与主观清晰度得分相关联。结果表明,从 Whisper 语音识别模型中提取的嵌入最适合,最后的编码器和解码器层在使用 Fréchet 音频距离时产生最佳相关性。值得注意的是,评估的距离优于经典的清晰度指标,并且比单词和字符错误率更稳健。此外,随着从中提取嵌入的 Whisper 模型大小的增加,相关性也会得到改善。