论文
用于 ASR 评估的生成器与编码器 大语言模型:比较研究
Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study
摘要
自动语音识别 (ASR) 通常使用词错误率 (WER) 进行评估,这不能很好地反映语义相似性。虽然基于嵌入的指标与人类判断的相关性更好,但基于编码器和解码器的 大语言模型 (LLM) 各自的作用仍未得到充分探索。本文提出了两个家庭 ASR 评估的比较研究。我们分析了不同 LLM、层和池化策略的 BERTScore 和 SemDist,结果表明,在正确配置的情况下,这两个指标都可以与人类判断实现强相关性。对于解码器模型,我们在两种设置中研究生成 LLM:通过提示进行成对假设选择和直接定性错误分类。我们的结果表明,基于编码器的指标仍然具有高度竞争力,而生成式 LLM 在假设比较中表现强劲,并提高了 ASR 评估的可解释性。