论文
超越 WER:重音会话 ASR 中的实体和不流利回忆
Beyond WER: Entity and Disfluency Recall in Accented Conversational ASR
摘要
针对单词错误率 (WER) 进行优化的 ASR 系统经常会错过命名实体,并在带口音的英语会话中填充停顿,这两者对于语言学习反馈都至关重要。我们为来自印度、印度尼西亚和拉丁美洲的演讲者提供了一个三阶段管道:(1) 启发式 SQL 过滤器以随机抽样实体密度的 2.8 倍来整理丰富的实体训练数据,(2) 在 Qwen2.5-Omni-3B 上进行微调的区域 LoRA 适配器,在一次前向传递中生成逐字记录和更正的转录本,以及 (3) 由大语言模型法官验证的六类错误分类法(83.8% 一致, 210 human-labelled samples).该管道在 6k 测试话语中实现了 80-85% 的实体召回率(从 53-55% 上升)、76-86% 的填充召回率(从 <5% 上升)和 6-10% 的 WER,在实体召回方面优于 Whisper 和商业 ASR,同时匹配参数减少 10 倍的零样本 30B 模型。配对引导测试证实,仅管理就占实体召回增益的 2.8-4.2 pp (p<0.0001)。