论文
VoiceCodeBench:评估自动语音识别中的精确结构化词元恢复
VoiceCodeBench: Evaluating Exact Structured-Token Recovery in Automatic Speech Recognition
摘要
自动语音识别通常通过单词错误率 (WER) 进行评估,尽管语音工作流程通常需要精确的书面值。 VoiceCodeBench 衡量转录是否保留下游软件所需的标识符、路径、命令和其他结构化标记。它包含 300 个人工录制的英语工作场所片段(5.59 小时,85 位发言者)和 26 个类型和 8 个领域的 1,482 个经过审计的实体。在纯原始音频协议下,我们使用 WER、规范词元/实体匹配 (CTEM) 和严格的分段级任务成功率 (TSR) 评估 19 个批处理和流系统。在各个系统中,WER 与 CTEM (Spearman $ρ=-0.28$) 或 TSR ($ρ=-0.22$) 的排名几乎没有一致性。最好的CTEM和TSR分别为91.8%和68.7%。因此,即使是最强大的系统也会留下近三分之一的录音具有未恢复的临界值。符号、分隔符和边界敏感实体是造成大多数错误的原因。