论文

FA-Bench:正常与噪声条件下字词、音素强制对齐和ASR时间戳评测

FA-Bench: A Benchmark for Word-Level and Phone-Level Forced-Alignment and ASR Timestamps Under Clean and Noisy Conditions

模型评测基准与评测资源评测方法与指标

摘要

强制对齐将语音音频与文本记录对齐,以生成单词和电话时间戳。已发布的比较对转录本进行标准化,以不同的方式分割数据并匹配边界,因此它们的数字无法一起读取。我们提出了 FA-Bench,这是一个开放框架,可以一次性修复这些选择并发布代码、拆分、电话映射、文本规范化和评分脚本,并定期发布结果。 Track 1 为每个对齐器提供参考转录本,Track 2 为其提供识别器的输出,以相同的音频、干净和降级四种方式,在统一协议下提供 21 个开放模型和 9 个商业 API。我们对话语的每个边界进行评分,并检查其旁边的两个标签,因此识别器错过或发明的单词将被收费。使用基于容差的 F1 作为我们的主要指标,可以消除标准 MAE 在会话语音中的依赖于识别的系统上造成 9% 到 14% 的分数膨胀。然后,我们根据边界的位置以及正确识别的相邻单词数量对边界进行分组,这表明系统在哪里失去了分数。我们发现当前系统对单词计时的方式存在系统性偏差,Whisper 提前了约 150 毫秒,而一些商业 ASR API 则延迟了超过 50 毫秒。代码和结果位于https://github.com/olewave/fa-bench