论文
Best-of-N语音合成评测受到ASR模型家族一致性的干扰
Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment
摘要
Best-of-N推理用自动语音识别ASR验证器选择候选语音,改善零样本语音合成的内容一致性。研究发现评测混杂:验证器的表面质量明显依赖评估ASR的模型家族。在LibriSpeech-PC与F5-TTS设置中,Whisper、wav2vec 2.0和HuBERT评估器给出的验证器排名差异明显;虽然表示高度相似,同家族的验证器与评估器组合仍比跨家族组合利用更多理想选择的提升空间。这指向模型身份或谱系层面的耦合,而非一般表示相似性。为减轻偏差,论文提出跨家族的排名平均与联合最大排名集成。两者均降低独立评估器测得的平均词错误率,没有降低自动相似性或质量指标;最佳集成在N=10时相对F5-TTS降低12%的WER。论文建议以多个独立评估器交叉核对,报告BoN语音合成性能。