论文

mu-bench:多语言话语转录基准

mu-bench: A Multilingual Utterance Transcription Benchmark

模型评测基准与评测资源评测方法与指标

摘要

语音Agent依靠准确的自动语音识别 (ASR) 来对呼叫者所说的内容采取行动,但 ASR 是根据阅读的、以英语为中心的语音和单词错误率 (WER) 进行评估的,这会惩罚表面差异而不是语义差异。我们引入了 mu-bench,这是一个数据集,包含 250 次以英语、西班牙语、土耳其语、越南语和普通话打给人工智能银行Agent的 4,270 条呼叫者话语,以姓名、电子邮件地址和确认码等表单字段输入为中心。我们发布了话语错误率 (UER),这是一种 LLM 判断记录是否保留意义的方法,根据人类评分者进行校准,同时还发布了一个 LLM 标准化器,使 WER 在不同提供商的输出格式之间具有可比性。在 1,847 个人工评分的转录本上,UER 与注释者一致,$\kappa$ = 0.78,而规范化文本上的完全匹配 WER 为 0.53。我们在公共排行榜上排名六家商业提供商;最好的达到 11.9% UER,普通话是这六人中最难的。