论文

使用生成式 大语言模型 评估自动语音识别

Evaluation of Automatic Speech Recognition Using Generative Large Language Models

模型评测评测方法与指标

摘要

自动语音识别 (ASR) 传统上使用字错误率 (WER) 进行评估,这是一种对含义不敏感的指标。基于嵌入的语义指标与人类感知的相关性更好,但基于解码器的 大语言模型 (LLM) 对此任务的探索仍然不足。本文通过三种方法评估它们的相关性:(1)在两个候选者之间选择最佳假设,(2)使用生成嵌入计算语义距离,以及(3)错误的定性分类。在 HATS 数据集上,最好的 LLM 在假设选择方面与人类注释者达到 92--94% 的一致性,而 WER 的一致性为 63%,也优于语义指标。基于解码器的 LLM 的嵌入显示出与编码器模型相当的性能。最后,LLM 为可解释和语义 ASR 评估提供了一个有前途的方向。