论文
重新思考以人为本的评估:WER 之外的语义指标分析
Rethinking Human-Aligned Evaluation: An Analysis of Semantic Metrics Beyond WER
摘要
单词错误率 (WER) 是自动语音识别 (ASR) 最常用的指标,它将与参考的每个词汇偏差视为同等成本,无论其是否改变含义。这就提出了一个问题:WER 是否真的跟踪人类如何判断 ASR 转录质量?我们引入了 HATS-en,一个用于以人为中心的 ASR 评估的英文数据集。使用此数据集,我们针对 BERTScore 和 SemDist 的多种配置对词汇指标进行基准测试,改变语言模型、层和池化策略。我们发现,在所有测试的指标中,WER 与人类判断的一致性最低,性能最佳的 SemDist 配置实现了最高的总体一致性,领先于 CER 和 BERTScore,并且没有一个模型在各个设置中都是最佳的。尽管 CER 简单且成本低廉,但仍然非常接近这些最佳配置。根据之前的建议,我们的结果支持将英语和词素书写系统的 ASR 评估转向 CER,因为它对于评估应实际捕获的内容而言是一种更可解释且成本更低的指标,并使用 SemDist 作为补充评估。