论文
MedWER:用于医学语音识别的可重复、无模型评估协议
MedWER: A Reproducible, Model-Free Evaluation Protocol for Medical Speech Recognition
摘要
总体单词错误率隐藏了临床严重错误:转录本的正确率可以达到 95%,但仍然可以将一种药物换成另一种药物。通常的修复权重是针对医疗实体的错误,并且几乎总是依赖于评估时命名实体识别 (NER) 模型或云 API,这使得指标的分母成为版本化的黑匣子。我们推出 MedWER,一种用于医疗 ASR 的评估协议和开源工具,其分母是一个固定的、许可干净的术语列表:从公共来源预测的 19,373 个药物、诊断、症状和损伤机制条目。该协议将固定文本标准化器与短语感知术语限制的 WER(MedWER)结合在一起,因此唯一的版本控制组件是在精确版本中保存的标准化器依赖项,并根据提交的标准测试用例进行检查。覆盖范围是根据独立的省级药物福利文件进行验证的,该清单并非根据该文件制定的;匹配启发式根据 真值 实体范围进行校准。 Moonshine~base、Whisper~base.en 和 MedASR 在两个开放基准上的基线使用已发布的工具进行评分,并根据重新采样的每个话语分数以 95% 的置信区间进行报告。